DeepSeek V4 API, chuẩn OpenAI
Cả hai bản DeepSeek V4 chính thức — deepseek-v4-flash và deepseek-v4-pro — với cửa sổ context 1.048.576 token, chạy trên hạ tầng Cloudflare Workers AI qua một endpoint chuẩn OpenAI. Credits USD trả trước, tính tiền theo token kiểm lại được từng dòng, và giảm 40% giá niêm yết trong dịp ra mắt.
Bạn nhận được gì
- Cửa sổ context
- 1.048.576 token (input + max_tokens)
- Function calling
- Có — đã kiểm bằng contract test trên cả hai model
- Reasoning
- Có — stream qua reasoning_content, chỉ tính tiền MỘT lần theo giá output
- Streaming
- SSE, đẩy từng chunk ngay
- ID nguồn (công khai)
- @cf/deepseek-ai/deepseek-v4-flash-0731 · @cf/deepseek-ai/deepseek-v4-pro-0813
- Riêng tư
- Chạy trên hạ tầng Cloudflare; chúng tôi chỉ log metadata — không bao giờ log nội dung prompt/response
Giá (giảm 40% so với niêm yết, tự áp)
- Input
$0,44$0,264- Output
$1,32$0,792
@cf/deepseek-ai/deepseek-v4-flash-0731
- Input
$1,32$0,792- Output
$3,96$2,376
@cf/deepseek-ai/deepseek-v4-pro-0813
Giá gạch = giá niêm yết. Giá cached-input và giá live của cả bảy model xem ở trang models; số ở đây được đồng bộ với database billing.
Số đo thật, không trích lại
Bài đo của chính chúng tôi, 16/08/2026. Trạng thái live và số từng model xem ở trang models.
~1,0 s
ra token đầu tiên, deepseek-v4-flash (p50, 5 stream)
~102 tok/s
tốc độ stream, deepseek-v4-flash (p50)
~45 ms / 1K token
tốc độ prefill ở cỡ input 100K–300K trên flash
76,5 s
token đầu với prompt 600K token thật (pro) — dùng streaming cho việc lớn
Chạy được chỉ với hai dòng config
Nếu code của bạn đã gọi API OpenAI — hoặc endpoint kiểu OpenAI của chính DeepSeek — bạn chỉ đổi base_url và key. ID model khớp cách đặt tên chính thức của DeepSeek.
from openai import OpenAI
client = OpenAI(
base_url="https://api.clfaigateway.dev/v1",
api_key="sk-gw-...", # app.clfaigateway.dev
)
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize this repository..."}],
stream=True,
)
for chunk in resp:
print(chunk.choices[0].delta.content or "", end="")DeepSeek V4 API — câu hỏi thường gặp
Phải — hai bản open-weight chính thức DeepSeek-V4-Flash-0731 và DeepSeek-V4-Pro-0813, chạy trên Cloudflare Workers AI. Chúng tôi công khai đúng ID nguồn trên mọi response để bạn tự kiểm thứ gì đang trả lời.
Xem ID nguồn →Không. Inference chạy trên bản triển khai open-weight do Cloudflare host. Về phía chúng tôi, chỉ log metadata của request (token, độ trễ, chi phí) — không bao giờ log nội dung prompt hay completion.
Chính sách dữ liệu →Cửa sổ là 1.048.576 token tính cả input lẫn max_tokens. Ở cỡ này prefill là công việc thật — khoảng 45 ms mỗi 1.000 token input theo bài đo của chúng tôi — nên hãy dùng streaming cho request lớn, và chấp nhận lỗi no_capacity (retry được) lúc cao điểm với prompt rất lớn.
Docs context & cache →Credits trả trước, theo token thật, theo giá hiện hành của từng model — giảm 40% giá niêm yết trong dịp ra mắt, tự áp. Mỗi request trả về đúng chi phí của nó, và request hỏng không sinh ra gì thì $0.
Docs billing →deepseek-v4-flash là lựa chọn hời: nhanh (khoảng 1 giây ra token đầu, ~100 tok/s đo thật) và giá bằng một phần ba Pro. deepseek-v4-pro là bản đầu bảng cho suy luận khó nhất trên context khổng lồ, xếp hàng lâu hơn lúc đông tải.