Bỏ qua, tới nội dung chính
deepseek-v4-flash · context 1M

DeepSeek V4 Flash API

Bản DeepSeek-V4-Flash chính thức: cửa sổ context 1.048.576 token ở mức giá ngựa thồ, và nhanh thật — khoảng 1 giây ra token đầu, ~100 token/giây theo bài đo của chúng tôi. Chuẩn OpenAI, chạy trên Cloudflare, giảm 40% niêm yết dịp ra mắt.

Thông số

Cửa sổ context
1.048.576 token (input + max_tokens)
Function calling
Có — gọi tool đúng schema trong contract test của chúng tôi
Reasoning
Có — nhận reasoning_effort; gateway mặc định low
ID nguồn (công khai)
@cf/deepseek-ai/deepseek-v4-flash-0731
Riêng tư
Cloudflare host; phía chúng tôi chỉ log metadata

Giá (giảm 40% so với niêm yết)

deepseek-v4-flashGiảm 40%
Input
$0,44$0,264
Output
$1,32$0,792

@cf/deepseek-ai/deepseek-v4-flash-0731

Giá gạch = niêm yết. Giá live đầy đủ, kể cả cached input, ở trang models.

Tốc độ đo thật

Bài đo của chúng tôi, 16/08/2026 — dám gọi Flash là nhanh vì đã tự kiểm.

~1,0 s

ra token đầu tiên (p50, 5 stream)

~102 tok/s

tốc độ stream (p50)

4,6 s

token đầu ở cỡ input 100K

13,2 s

token đầu ở cỡ input 300K (~45 ms mỗi 1K token)

Bắt đầu nhanh

SDK OpenAI giữ nguyên — đặt base_url, dùng model id deepseek-v4-flash.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.clfaigateway.dev/v1",
    api_key="sk-gw-...",  # app.clfaigateway.dev
)

resp = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize this repository..."}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

deepseek-v4-flash — câu hỏi thường gặp

Agent loop context dài, hỏi-đáp trên repo và tài liệu, trích xuất và phân loại khối lượng lớn — bất cứ chỗ nào bạn cần cửa sổ 1M và tốc độ thật mà không phải trả giá đầu bảng. Model gọi tool đúng schema và stream cả phần suy luận.

Cùng cửa sổ 1M và cùng bộ tokenizer; Flash giá bằng khoảng một phần ba Pro, ra token đầu nhanh hơn nhiều trong bài đo của chúng tôi, và là mặc định đúng. Đẩy bài suy luận khó nhất lên Pro khi chất lượng của việc cụ thể đó đòi hỏi.

deepseek-v4-pro →

Request rất lớn (600K+ token) có thể gặp lỗi capacity (retry được) lúc cao điểm, và rate limit theo phút của model lớp frontier chặt hơn model nhỏ. Gateway trả 429 trung thực kèm retry-after; SDK chính thức tự backoff.

Docs rate-limit →