Qwen 3.8 27B API, chuẩn OpenAI
Qwen 3.8 27B của Alibaba sau một endpoint chuẩn OpenAI, chạy trên Cloudflare Workers AI: cửa sổ context 262.144 token, tool calling đã kiểm bằng contract test, và khả năng đọc ảnh do chính chúng tôi probe trước khi bật. Credits USD trả trước, tính tiền theo token kiểm lại được từng dòng, giảm 40% giá niêm yết trong dịp ra mắt.
Bạn nhận được gì
- Cửa sổ context
- 262.144 token (input + max_tokens)
- Đầu vào ảnh
- Có — đã kiểm trên chính model này; gửi ảnh dạng base64 data URI
- Function calling
- Có — gọi tool đúng schema trong contract test của chúng tôi
- Reasoning
- Có — stream qua reasoning_content, chỉ tính tiền MỘT lần theo giá output
- Output tối đa
- 4.096 token mỗi request
- ID nguồn (công khai)
- @cf/qwen/qwen3.8-27b
- Riêng tư
- Chạy trên hạ tầng Cloudflare; chúng tôi chỉ log metadata — không bao giờ log nội dung prompt/response
Giá (giảm 40% so với niêm yết, tự áp)
- Input
$0,45$0,27- Output
$3,20$1,92
@cf/qwen/qwen3.8-27b
Giá gạch = giá niêm yết. Giá live của cả bảy model xem ở trang models, đồng bộ từ đúng database billing đang tính tiền request của bạn.
Số đo thật, không trích lại
Bài đo của chính chúng tôi, 18/08/2026. Trạng thái live và số từng model xem ở trang models.
1,14 s
ra token đầu với prompt 2K token
165–195 ms / 1K token
tốc độ prefill — chậm hơn dòng DeepSeek Flash của chúng tôi
1,9 s
byte đầu tiên với prompt 150K token (câu trả lời đầy đủ đến sau)
6 / 6
contract test đạt, gồm cả gọi tool
Chạy được chỉ với hai dòng config
Nếu code của bạn đã gọi API OpenAI thì chỉ đổi base_url và key. Không đụng gì thêm.
from openai import OpenAI
client = OpenAI(
base_url="https://api.clfaigateway.dev/v1",
api_key="sk-gw-...", # app.clfaigateway.dev
)
resp = client.chat.completions.create(
model="qwen3.8-27b",
messages=[{"role": "user", "content": "Explain this stack trace..."}],
stream=True,
)
for chunk in resp:
print(chunk.choices[0].delta.content or "", end="")Qwen 3.8 27B API — câu hỏi thường gặp
Có, và chúng tôi tự kiểm chứ không tin bảng thông số: gửi ảnh vào và xác nhận model trả lời đúng theo thứ có trong ảnh. Gửi ảnh nhúng thẳng dạng base64 data URI; link http(s) không được tải về. Chúng tôi mới kiểm ảnh thường — CHƯA đo chữ nhỏ, tài liệu scan hay biểu đồ dày đặc, nên không hứa OCR.
Cách gửi ảnh →Khoảng 1,1 giây ra token đầu với prompt ngắn. Phần chậm là prefill — cỡ 165–195 ms mỗi 1.000 token input, chậm hơn vài lần so với dòng DeepSeek Flash của chúng tôi — nên prompt rất lớn sẽ mất thời gian thật trước khi câu trả lời bắt đầu. Byte đầu tiên vẫn về sau khoảng 1,9 giây kể cả ở 150K token, nên hãy stream để người dùng thấy tiến triển ngay.
So sánh model →Model này hiện không có. Prefix cache chưa hoạt động với nó trong bài đo của chúng tôi, nên chúng tôi để giá cached input bằng giá input thường thay vì quảng cáo một khoản tiết kiệm bạn sẽ không nhận được. Nếu điều đó đổi, chúng tôi định giá lại, và trang models luôn hiện giá đang áp.
Docs context & cache →Credits trả trước, theo token thật, theo giá hiện hành của model — giảm 40% niêm yết trong dịp ra mắt, tự áp. Mỗi request trả về đúng chi phí của nó, và request hỏng không sinh ra gì thì $0.
Docs billing →