Bỏ qua, tới nội dung chính

Model & giá

Bảy model production, giá USD trên 1 triệu token. ID nguồn công khai.

ModelKhả năngContextInputInput (cache)Output
glm-5.2Giảm 40%@cf/zai-org/glm-5.2toolsreasoningjson262K$1,40$0,84$0,26$0,156$4,40$2,64
kimi-k2.7-codeGiảm 40%@cf/moonshotai/kimi-k2.7-codetoolsvisionreasoning262K$0,95$0,57$0,19$0,114$4,00$2,40
kimi-k2.6Giảm 40%@cf/moonshotai/kimi-k2.6toolsvisionreasoning262K$0,95$0,57$0,16$0,096$4,00$2,40
glm-4.7-flashGiảm 40%@cf/zai-org/glm-4.7-flashtoolsreasoningfast131K$0,06$0,036$0,40$0,24
deepseek-v4-flashGiảm 40%@cf/deepseek-ai/deepseek-v4-flash-0731toolsreasoningfast1M$0,44$0,264$0,014$0,008$1,32$0,792
deepseek-v4-proGiảm 40%@cf/deepseek-ai/deepseek-v4-pro-0813toolsreasoningjson1M$1,32$0,792$0,044$0,026$3,96$2,376
qwen3.8-27bGiảm 40%@cf/qwen/qwen3.8-27btoolsreasoningvision262K$0,45$0,27$0,45$0,27$3,20$1,92

Trúng cache toàn phần chỉ tính 10% giá thường. Giá tại ngày 2026-08-18 — dashboard luôn hiện giá live.

glm-5.2

Giảm 40%@cf/zai-org/glm-5.2

Model đầu bảng của Z.ai. Mạnh nhất ở suy luận nhiều bước, toán và phân tích ngữ cảnh dài; hỗ trợ tool call và JSON output chặt.

Cửa sổ context262K
Khả năngtoolsreasoningjson

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$1,40$0,84
Input (cache)$0,26$0,156
Output$4,40$2,64

kimi-k2.7-code

Giảm 40%@cf/moonshotai/kimi-k2.7-code

Chuyên gia code của Moonshot AI. Tinh chỉnh cho việc code quy mô cả repo và agentic tool use, kèm vision đọc screenshot và sơ đồ.

Cửa sổ context262K
Khả năngtoolsvisionreasoning

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,95$0,57
Input (cache)$0,19$0,114
Output$4,00$2,40

kimi-k2.6

Giảm 40%@cf/moonshotai/kimi-k2.6

Model Kimi đa dụng cân bằng chất lượng và chi phí. Tool call và vision tốt — lựa chọn mặc định vững cho assistant và agent.

Cửa sổ context262K
Khả năngtoolsvisionreasoning

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,95$0,57
Input (cache)$0,16$0,096
Output$4,00$2,40

glm-4.7-flash

Giảm 40%@cf/zai-org/glm-4.7-flash

Con ngựa thồ nhanh, giá rẻ. Trung vị thời gian ra token đầu khoảng 0,65 giây theo bài đo của chúng tôi — hợp phân loại, trích xuất và chat khối lượng lớn.

Cửa sổ context131K
Khả năngtoolsreasoningfast

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,06$0,036
Input (cache)
Output$0,40$0,24

deepseek-v4-flash

Giảm 40%@cf/deepseek-ai/deepseek-v4-flash-0731

Bản V4 Flash chính thức của DeepSeek với cửa sổ context 1 triệu token. Nhanh trong bài đo của chúng tôi (~1 giây ra token đầu, ~100 tok/s), tool calling agentic tốt — lựa chọn hời cho việc ngữ cảnh dài.

Cửa sổ context1M
Khả năngtoolsreasoningfast

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,44$0,264
Input (cache)$0,014$0,008
Output$1,32$0,792

deepseek-v4-pro

Giảm 40%@cf/deepseek-ai/deepseek-v4-pro-0813

Model V4 đầu bảng của DeepSeek: context 1 triệu token, suy luận sâu và function calling ổn định. Sinh ra cho phân tích cỡ cả repo và tài liệu dài.

Cửa sổ context1M
Khả năngtoolsreasoningjson

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$1,32$0,792
Input (cache)$0,044$0,026
Output$3,96$2,376

qwen3.8-27b

Giảm 40%@cf/qwen/qwen3.8-27b

Qwen 3.8 27B của Alibaba — khả năng đọc ảnh do chính chúng tôi probe xác nhận, không chép từ bảng thông số. Gửi ảnh kèm văn bản trong cùng một request; context 262K token, có tool calling và reasoning.

Cửa sổ context262K
Khả năngtoolsreasoningvision

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,45$0,27
Input (cache)$0,45$0,27
Output$3,20$1,92

Về token suy luận: model suy luận trả phần "suy nghĩ" như một phần của output. Số token đó là tập con của token output, chỉ bị tính tiền MỘT lần theo giá output, và được tách riêng trong usage log — không bao giờ bị cộng thêm.