Bỏ qua, tới nội dung chính
← Tất cả bài viết
Sản phẩm

DeepSeek V4 lên sóng: context 1 triệu token, giảm 40% niêm yết

Đọc 4 phút

Từ hôm nay gateway phục vụ hai bản DeepSeek V4 chính thức: deepseek-v4-flashdeepseek-v4-pro. Cả hai mang cửa sổ context 1.048.576 token — gấp bốn lần trần 262K của dàn model hiện tại — và cùng vào chương trình ra mắt: giảm 40% giá niêm yết, tự áp cho mọi request.

Một triệu token mua được gì cho bạn

Cửa sổ 1M nhét vừa nguyên một repo cỡ vừa, một năm ticket hỗ trợ, hay trọn bộ hồ sơ pháp lý trong MỘT request — không pipeline cắt khúc, không keo dán retrieval, không logic "bỏ nửa nào". Bạn gửi cả cục; model thấy cả cục. Chúng tôi không bao giờ cắt bớt hay viết lại messages, nên cái gì vừa là vừa thật.

Cửa sổ đếm input cộng ngân sách max_tokens, và giới hạn đúng bằng 1.048.576 — request quá cỡ bị từ chối ngay bằng context_length_exceeded trước khi sinh chữ nào, tính $0. Docs context nói kỹ cách đếm, endpoint miễn phí /v1/count_tokens, và bảng sai số theo ngôn ngữ chúng tôi đo cho tokenizer DeepSeek.

Số đo thật, vì chúng tôi không trích số marketing

  • `deepseek-v4-flash` nhanh thật: ~1,0 giây ra token đầu (p50) và ~102 token/giây khi stream trong bài đo của chúng tôi — throughput nhanh nhất catalog, ở mức giá ngựa thồ.
  • Prefill ở cỡ lớn là công việc thật: ~45 ms mỗi 1.000 token input trên flash — prompt 100K token ra token đầu sau 4,6 giây, 300K sau 13,2 giây.
  • `deepseek-v4-pro` đánh đổi độ trễ lấy độ sâu: ~2,5 giây ra token đầu với prompt ngắn, ~44 tok/s, và 76,5 giây với prompt 600K token thật. Việc lớn thì luôn stream.
  • Function calling đã kiểm chứng: trong contract test của chúng tôi, cả hai model gọi tool đúng schema — vòng lặp agentic chạy thật, không chỉ đẹp trên spec.

Dữ liệu của bạn ở lại hạ tầng Cloudflare

Đây là các bản open-weight chính thức chạy trên Cloudflare Workers AI — ID nguồn @cf/deepseek-ai/deepseek-v4-flash-0731@cf/deepseek-ai/deepseek-v4-pro-0813 công khai trên mọi response. Prompt của bạn được xử lý trên hạ tầng đó và không gửi về server của DeepSeek; phía chúng tôi chỉ log metadata của request — token, độ trễ, chi phí — không bao giờ log nội dung.

Giá: giảm 40% niêm yết, live trên trang models

Trong dịp ra mắt, deepseek-v4-flash tính $0.264 / $0.792 mỗi 1M token (input/output, niêm yết $0.44 / $1.32) và deepseek-v4-pro tính $0.792 / $2.376 (niêm yết $1.32 / $3.96). Giá niêm yết gạch ngang và giá đang bán đều nằm trên trang models, đồng bộ từ đúng database billing đang tính tiền request của bạn — giá bạn thấy là giá bạn trả.

ID model khớp cách đặt tên của chính DeepSeek, nên nếu code của bạn đã chạy với endpoint kiểu OpenAI thì chuyển nhà chỉ là base_url cộng một cái key: đăng ký ở app.clfaigateway.dev, nạp VietQR hoặc thẻ quốc tế, gửi request đầu tiên. Bài sâu hơn ở /vi/deepseek-v4-api, /vi/deepseek-v4-flash/vi/deepseek-v4-pro.

Câu hỏi thường gặp

Context 1M có trên cả hai model không?

Có — cả deepseek-v4-flash lẫn deepseek-v4-pro đều có cùng cửa sổ 1.048.576 token, đếm input cộng max_tokens.

Đây có phải DeepSeek V4 chính thức không?

Phải, các bản open-weight chính thức (snapshot 0731 và 0813), chạy trên Cloudflare Workers AI. ID nguồn công khai trên mọi response.

Giảm 40% kéo dài bao lâu?

Trong dịp ra mắt, áp cho cả catalog. Giá live trên trang models luôn là giá được tính.