Bỏ qua, tới nội dung chính
deepseek-v4-pro · context 1M

DeepSeek V4 Pro API

Bản đầu bảng của DeepSeek V4 (bản 0813 chính thức) cho việc khó nhất: phân tích cỡ cả repo, suy luận trên tài liệu dài và function calling ổn định trên cửa sổ 1.048.576 token — sau một endpoint chuẩn OpenAI, chạy trên Cloudflare.

Thông số

Cửa sổ context
1.048.576 token (input + max_tokens)
Function calling
Có — gọi tool đúng schema trong contract test của chúng tôi
Reasoning
Có — nhận reasoning_effort; gateway mặc định low
ID nguồn (công khai)
@cf/deepseek-ai/deepseek-v4-pro-0813
Riêng tư
Cloudflare host; phía chúng tôi chỉ log metadata

Giá (giảm 40% so với niêm yết)

deepseek-v4-proGiảm 40%
Input
$1,32$0,792
Output
$3,96$2,376

@cf/deepseek-ai/deepseek-v4-pro-0813

Giá gạch = niêm yết. Giá live đầy đủ, kể cả cached input, ở trang models.

Nết vận hành đo được

Bài đo của chúng tôi, 16/08/2026. Pro đánh đổi độ trễ lấy độ sâu — hãy tính trước điều đó.

~2,5 s

ra token đầu với prompt ngắn (p50)

~44 tok/s

tốc độ stream (p50)

31,5 s

token đầu ở cỡ input 300K

76,5 s

token đầu ở cỡ input 600K — việc lớn LUÔN dùng streaming

Bắt đầu nhanh

SDK OpenAI giữ nguyên — đặt base_url, dùng model id deepseek-v4-pro.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.clfaigateway.dev/v1",
    api_key="sk-gw-...",  # app.clfaigateway.dev
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Summarize this repository..."}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

deepseek-v4-pro — câu hỏi thường gặp

Khi chất lượng câu trả lời trên bài suy luận khó quan trọng hơn độ trễ và giá: phân tích nhiều bước trên context khổng lồ, refactor hóc búa, tài liệu pháp lý/nghiên cứu dài. Còn agent loop khối lượng lớn và trích xuất thì Flash — giá bằng một phần ba — thường là lựa chọn khôn hơn.

So với Flash →

Prefill vài trăm nghìn token là khối lượng tính toán thật — chúng tôi đo 76,5 giây tới token đầu với prompt 600K token, và model có thể xếp hàng lúc đông tải. Gateway đã tính ngân sách chờ cho việc này (không cắt oan request lớn thành "treo"); phía bạn hãy stream và giữ kết nối.

Docs streaming →

Không. Reasoning stream qua reasoning_content và token của nó nằm trong completion_tokens, chỉ tính MỘT lần theo giá output. Usage log tách riêng phần reasoning để suy nghĩ dài không bao giờ thành bất ngờ trên hóa đơn.

Docs billing →