Bỏ qua, tới nội dung chính
DeepSeek V4 · context 1M

DeepSeek V4 API, chuẩn OpenAI

Cả hai bản DeepSeek V4 chính thức — deepseek-v4-flash và deepseek-v4-pro — với cửa sổ context 1.048.576 token, chạy trên hạ tầng Cloudflare Workers AI qua một endpoint chuẩn OpenAI. Credits USD trả trước, tính tiền theo token kiểm lại được từng dòng, và giảm 40% giá niêm yết trong dịp ra mắt.

Bạn nhận được gì

Cửa sổ context
1.048.576 token (input + max_tokens)
Function calling
Có — đã kiểm bằng contract test trên cả hai model
Reasoning
Có — stream qua reasoning_content, chỉ tính tiền MỘT lần theo giá output
Streaming
SSE, đẩy từng chunk ngay
ID nguồn (công khai)
@cf/deepseek-ai/deepseek-v4-flash-0731 · @cf/deepseek-ai/deepseek-v4-pro-0813
Riêng tư
Chạy trên hạ tầng Cloudflare; chúng tôi chỉ log metadata — không bao giờ log nội dung prompt/response

Giá (giảm 40% so với niêm yết, tự áp)

deepseek-v4-flashGiảm 40%
Input
$0,44$0,264
Output
$1,32$0,792

@cf/deepseek-ai/deepseek-v4-flash-0731

deepseek-v4-proGiảm 40%
Input
$1,32$0,792
Output
$3,96$2,376

@cf/deepseek-ai/deepseek-v4-pro-0813

Giá gạch = giá niêm yết. Giá cached-input và giá live của cả bảy model xem ở trang models; số ở đây được đồng bộ với database billing.

Số đo thật, không trích lại

Bài đo của chính chúng tôi, 16/08/2026. Trạng thái live và số từng model xem ở trang models.

~1,0 s

ra token đầu tiên, deepseek-v4-flash (p50, 5 stream)

~102 tok/s

tốc độ stream, deepseek-v4-flash (p50)

~45 ms / 1K token

tốc độ prefill ở cỡ input 100K–300K trên flash

76,5 s

token đầu với prompt 600K token thật (pro) — dùng streaming cho việc lớn

Chạy được chỉ với hai dòng config

Nếu code của bạn đã gọi API OpenAI — hoặc endpoint kiểu OpenAI của chính DeepSeek — bạn chỉ đổi base_url và key. ID model khớp cách đặt tên chính thức của DeepSeek.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.clfaigateway.dev/v1",
    api_key="sk-gw-...",  # app.clfaigateway.dev
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize this repository..."}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

DeepSeek V4 API — câu hỏi thường gặp

Phải — hai bản open-weight chính thức DeepSeek-V4-Flash-0731 và DeepSeek-V4-Pro-0813, chạy trên Cloudflare Workers AI. Chúng tôi công khai đúng ID nguồn trên mọi response để bạn tự kiểm thứ gì đang trả lời.

Xem ID nguồn →

Không. Inference chạy trên bản triển khai open-weight do Cloudflare host. Về phía chúng tôi, chỉ log metadata của request (token, độ trễ, chi phí) — không bao giờ log nội dung prompt hay completion.

Chính sách dữ liệu →

Cửa sổ là 1.048.576 token tính cả input lẫn max_tokens. Ở cỡ này prefill là công việc thật — khoảng 45 ms mỗi 1.000 token input theo bài đo của chúng tôi — nên hãy dùng streaming cho request lớn, và chấp nhận lỗi no_capacity (retry được) lúc cao điểm với prompt rất lớn.

Docs context & cache →

Credits trả trước, theo token thật, theo giá hiện hành của từng model — giảm 40% giá niêm yết trong dịp ra mắt, tự áp. Mỗi request trả về đúng chi phí của nó, và request hỏng không sinh ra gì thì $0.

Docs billing →

deepseek-v4-flash là lựa chọn hời: nhanh (khoảng 1 giây ra token đầu, ~100 tok/s đo thật) và giá bằng một phần ba Pro. deepseek-v4-pro là bản đầu bảng cho suy luận khó nhất trên context khổng lồ, xếp hàng lâu hơn lúc đông tải.