Bỏ qua, tới nội dung chính
GLM 5.3 Flash · context 1M · vision

GLM 5.3 Flash API, chuẩn OpenAI

GLM 5.3 Flash của Z.ai — model multimodal bẩm sinh đầu tiên của dòng GLM-5, kiến trúc MoE 320B tham số nhưng mỗi token chỉ kích hoạt 18B — với cửa sổ context 1.048.576 token và khả năng đọc ảnh do chính chúng tôi probe xác nhận trước khi bán. Chạy trên hạ tầng Cloudflare Workers AI qua một endpoint chuẩn OpenAI: credits USD trả trước, tính tiền theo từng token kiểm chứng được, và giảm 40% giá niêm yết trong dịp ra mắt.

Bạn nhận được gì

Cửa sổ context
1.048.576 token (input + max_tokens)
Kiến trúc (theo Z.ai)
MoE, 320B tổng / 18B tham số kích hoạt; attention lai linear + sparse sinh ra để hạ chi phí phục vụ context dài — đúng thứ bảng giá bên dưới phản ánh
Đầu vào ảnh
Có — probe của chúng tôi xác nhận 2/2 ngày 27/08/2026, base64 data URI
Function calling
Có — kiểm qua contract test, tool được gọi đúng schema
Reasoning
Có — stream dưới dạng reasoning_content, tính tiền một lần theo giá output; nhận cả bốn mức effort low/medium/high/xhigh
Cached input
Dòng giá thật có công bố — xem ghi chú cache bên dưới
ID nguồn (công khai)
@cf/zai-org/glm-5.3-flash
Riêng tư
Chạy trên hạ tầng Cloudflare; chúng tôi chỉ log metadata — không bao giờ log nội dung prompt hay response

Giá (giảm 40% so với niêm yết, tự áp)

glm-5.3-flashGiảm 40%
Input
$0,15$0,09
Output
$0,50$0,30

@cf/zai-org/glm-5.3-flash

Giá gạch = giá niêm yết. Giá cached-input là dòng giá thật có công bố và bài đo của chúng tôi thấy lượt trúng cache được tính đúng giá đó — nhưng hit phía nguồn chưa đều, nên hãy coi khoản giảm là phần thưởng thêm chứ đừng đưa vào ngân sách. Giá live của cả tám model ở trang models, đồng bộ từ đúng database billing đang tính tiền request của bạn.

Số đo, không phải số chép

Bài đo của chính chúng tôi, 27/08/2026 — đúng ngày thêm model. Trạng thái live và số theo từng model nằm ở trang models.

~1,6 s

tới token đầu tiên (p50, 5 stream, không lượt nào treo)

~80 tok/s

tốc độ stream (p50)

31–47 ms / 1K token

tốc độ prefill đo ở cỡ input 150K–600K

~19 s

token đầu trên prompt 600K token thật — việc lớn hãy luôn dùng streaming

Chạy được chỉ với hai dòng config

Nếu code của bạn đã gọi API OpenAI, bạn chỉ đổi base_url và key. ID model là glm-5.3-flash; ID nguồn công khai.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.clfaigateway.dev/v1",
    api_key="sk-gw-...",  # app.clfaigateway.dev
)

resp = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Summarize this repository..."}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

GLM 5.3 Flash trên gateway — câu hỏi thường gặp

Cửa sổ tính cả input lẫn ngân sách max_tokens. Ở cỡ này prefill là công việc thật — chúng tôi đo được khoảng 31–47 ms mỗi 1.000 token input, nên prompt 600K token mất chừng 19 giây mới ra token đầu. Request lớn hãy luôn stream, và chấp nhận lỗi hết công suất (retry được) lúc cao điểm với prompt rất lớn.

Docs context & cache →

Thật — và chúng tôi kiểm trước khi bán. Cùng bài probe với cả catalog: hai ảnh đặc màu, model phải nhận đúng cả hai. GLM 5.3 Flash đạt 2/2 ngày 27/08/2026. Ảnh gửi dạng base64 data URI trong mảng content chuẩn; link http(s) bị từ chối ngay từ đầu. Z.ai còn công bố kết quả mạnh về đọc tài liệu và biểu đồ (OfficeQA Pro 62,4 trên PDF chỉ-có-ảnh, CharXiv Reasoning 89,4) — chúng tôi chưa tự probe chất lượng OCR, nên hãy thử trên tài liệu của bạn trước.

Model nào đọc được ảnh →

Benchmark do chính Z.ai công bố cho nó vượt GLM-5.2 toàn diện — 63,4 vs 46,2 trên DeepSWE v1.1, 48,8 vs 26,2 trên AutomationBench, 78,4 vs 59,9 trên Toolathlon Verified — và tiệm cận các model frontier lớn hơn nhiều ở mảng code và agent. Đó là số của nhà phát hành, không phải của chúng tôi; thứ chúng tôi tự kiểm là bảng phía trên. Một con số là của chúng tôi: trên bảng giá ở đây, giá input của nó rẻ hơn glm-5.2 khoảng 9 lần.

So giá live →

Dòng giá là thật và có công bố phía nguồn, và bài đo của chúng tôi thấy lượt trúng cache được tính đúng giá đó. Nhưng cũng trong cùng bài đo, có những lượt lặp nguyên văn vẫn trượt cache — hit chưa đều, nên chúng tôi nói thẳng thay vì hứa khoản tiết kiệm. Khi trúng, giá cached tự áp.

Cache hoạt động ra sao →

Chúng tôi thêm nó đúng ngày nó xuất hiện, tự đo mọi con số công bố, và trong lúc đo có gặp lỗi thoáng qua phía nguồn — kiểu lỗi retry là qua. Gateway dịch chúng thành lỗi retry-được sạch sẽ và tự failover khi còn đường. Nếu độ ổn định thay đổi, trang status và trang này sẽ nói thẳng.

Credits trả trước, tính theo token thật từ usage của nguồn — không bao giờ theo ước lượng. Token reasoning thuộc phần output và chỉ tính một lần. Mỗi request hiện đúng chi phí trong usage log, và sổ cái khớp tới từng nano-đô.

Docs billing →