DeepSeek V4 Pro API
Bản đầu bảng của DeepSeek V4 (bản 0813 chính thức) cho việc khó nhất: phân tích cỡ cả repo, suy luận trên tài liệu dài và function calling ổn định trên cửa sổ 1.048.576 token — sau một endpoint chuẩn OpenAI, chạy trên Cloudflare.
Thông số
- Cửa sổ context
- 1.048.576 token (input + max_tokens)
- Function calling
- Có — gọi tool đúng schema trong contract test của chúng tôi
- Reasoning
- Có — nhận reasoning_effort; gateway mặc định low
- ID nguồn (công khai)
- @cf/deepseek-ai/deepseek-v4-pro-0813
- Riêng tư
- Cloudflare host; phía chúng tôi chỉ log metadata
Giá (giảm 40% so với niêm yết)
- Input
$1,32$0,792- Output
$3,96$2,376
@cf/deepseek-ai/deepseek-v4-pro-0813
Giá gạch = niêm yết. Giá live đầy đủ, kể cả cached input, ở trang models.
Nết vận hành đo được
Bài đo của chúng tôi, 16/08/2026. Pro đánh đổi độ trễ lấy độ sâu — hãy tính trước điều đó.
~2,5 s
ra token đầu với prompt ngắn (p50)
~44 tok/s
tốc độ stream (p50)
31,5 s
token đầu ở cỡ input 300K
76,5 s
token đầu ở cỡ input 600K — việc lớn LUÔN dùng streaming
Bắt đầu nhanh
SDK OpenAI giữ nguyên — đặt base_url, dùng model id deepseek-v4-pro.
from openai import OpenAI
client = OpenAI(
base_url="https://api.clfaigateway.dev/v1",
api_key="sk-gw-...", # app.clfaigateway.dev
)
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Summarize this repository..."}],
stream=True,
)
for chunk in resp:
print(chunk.choices[0].delta.content or "", end="")deepseek-v4-pro — câu hỏi thường gặp
Khi chất lượng câu trả lời trên bài suy luận khó quan trọng hơn độ trễ và giá: phân tích nhiều bước trên context khổng lồ, refactor hóc búa, tài liệu pháp lý/nghiên cứu dài. Còn agent loop khối lượng lớn và trích xuất thì Flash — giá bằng một phần ba — thường là lựa chọn khôn hơn.
So với Flash →Prefill vài trăm nghìn token là khối lượng tính toán thật — chúng tôi đo 76,5 giây tới token đầu với prompt 600K token, và model có thể xếp hàng lúc đông tải. Gateway đã tính ngân sách chờ cho việc này (không cắt oan request lớn thành "treo"); phía bạn hãy stream và giữ kết nối.
Docs streaming →Không. Reasoning stream qua reasoning_content và token của nó nằm trong completion_tokens, chỉ tính MỘT lần theo giá output. Usage log tách riêng phần reasoning để suy nghĩ dài không bao giờ thành bất ngờ trên hóa đơn.
Docs billing →