glm-5.2
Giảm 40%@cf/zai-org/glm-5.2Model đầu bảng của Z.ai. Mạnh nhất ở suy luận nhiều bước, toán và phân tích ngữ cảnh dài; hỗ trợ tool call và JSON output chặt.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Bảy model production, giá USD trên 1 triệu token. ID nguồn công khai.
| Model | Khả năng | Context | Input | Input (cache) | Output |
|---|---|---|---|---|---|
| glm-5.2Giảm 40%@cf/zai-org/glm-5.2 | toolsreasoningjson | 262K | |||
| kimi-k2.7-codeGiảm 40%@cf/moonshotai/kimi-k2.7-code | toolsvisionreasoning | 262K | |||
| kimi-k2.6Giảm 40%@cf/moonshotai/kimi-k2.6 | toolsvisionreasoning | 262K | |||
| glm-4.7-flashGiảm 40%@cf/zai-org/glm-4.7-flash | toolsreasoningfast | 131K | — | ||
| deepseek-v4-flashGiảm 40%@cf/deepseek-ai/deepseek-v4-flash-0731 | toolsreasoningfast | 1M | |||
| deepseek-v4-proGiảm 40%@cf/deepseek-ai/deepseek-v4-pro-0813 | toolsreasoningjson | 1M | |||
| qwen3.8-27bGiảm 40%@cf/qwen/qwen3.8-27b | toolsreasoningvision | 262K |
Trúng cache toàn phần chỉ tính 10% giá thường. Giá tại ngày 2026-08-18 — dashboard luôn hiện giá live.
Model đầu bảng của Z.ai. Mạnh nhất ở suy luận nhiều bước, toán và phân tích ngữ cảnh dài; hỗ trợ tool call và JSON output chặt.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Chuyên gia code của Moonshot AI. Tinh chỉnh cho việc code quy mô cả repo và agentic tool use, kèm vision đọc screenshot và sơ đồ.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Model Kimi đa dụng cân bằng chất lượng và chi phí. Tool call và vision tốt — lựa chọn mặc định vững cho assistant và agent.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Con ngựa thồ nhanh, giá rẻ. Trung vị thời gian ra token đầu khoảng 0,65 giây theo bài đo của chúng tôi — hợp phân loại, trích xuất và chat khối lượng lớn.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Bản V4 Flash chính thức của DeepSeek với cửa sổ context 1 triệu token. Nhanh trong bài đo của chúng tôi (~1 giây ra token đầu, ~100 tok/s), tool calling agentic tốt — lựa chọn hời cho việc ngữ cảnh dài.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Model V4 đầu bảng của DeepSeek: context 1 triệu token, suy luận sâu và function calling ổn định. Sinh ra cho phân tích cỡ cả repo và tài liệu dài.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Qwen 3.8 27B của Alibaba — khả năng đọc ảnh do chính chúng tôi probe xác nhận, không chép từ bảng thông số. Gửi ảnh kèm văn bản trong cùng một request; context 262K token, có tool calling và reasoning.
Token suy luận tính theo giá output — không bao giờ tính hai lần.
Về token suy luận: model suy luận trả phần "suy nghĩ" như một phần của output. Số token đó là tập con của token output, chỉ bị tính tiền MỘT lần theo giá output, và được tách riêng trong usage log — không bao giờ bị cộng thêm.