Bỏ qua, tới nội dung chính
GLM 5.3 · context 1M · coding chủ lực

GLM 5.3 API, chuẩn OpenAI

GLM 5.3 của Z.ai — model coding chủ lực (flagship) của dòng GLM-5 — ghép cửa sổ context 1.048.576 token với reasoning, function calling và structured outputs, ở đúng mức giá niêm yết mà GLM-5.2 thu cho cửa sổ 262K. Chạy trên hạ tầng Cloudflare Workers AI qua một endpoint chuẩn OpenAI: credits USD trả trước, tính tiền theo từng token kiểm chứng được, và giảm 40% giá niêm yết trong dịp ra mắt.

Bạn nhận được gì

Cửa sổ context
1.048.576 token (input + max_tokens) — gấp 4 lần GLM-5.2, xác nhận qua chính thông báo giới hạn của endpoint
Định vị (theo Z.ai)
Model coding chủ lực cho agentic workflow — sinh ra cho các luồng phát triển nhiều bước, chạy bằng tool
Đầu vào ảnh
Không — probe của chúng tôi ra 0/2: model nhận ảnh rồi trả lời rằng nó không thấy được. Gateway từ chối request kèm ảnh tới model này ngay từ đầu, nêu đích danh, trước khi bạn mất đồng nào; bốn model khác trong catalog đọc được ảnh
Function calling
Có — kiểm qua contract test, tool được gọi đúng schema
Reasoning
Có — stream dưới dạng reasoning_content, tính tiền một lần theo giá output; các mức effort none/low/medium/high/max (bộ mức KHÁC GLM 5.3 Flash — gateway validate theo từng model)
JSON mode
Có — đã kiểm: response_format json_object trả JSON hợp lệ. Nhớ nới max_tokens — model suy nghĩ trước rồi mới trả lời
Cached input
Dòng giá có công bố — bài đo lặp của chúng tôi CHƯA thấy lượt hit nào trên model này; xem ghi chú cache bên dưới
ID nguồn (công khai)
@cf/zai-org/glm-5.3
Riêng tư
Chạy trên hạ tầng Cloudflare; chúng tôi chỉ log metadata — không bao giờ log nội dung prompt hay response

Giá (giảm 40% so với niêm yết, tự áp)

glm-5.3Giảm 40%
Input
$1,40$0,84
Output
$4,40$2,64

@cf/zai-org/glm-5.3

Giá gạch = giá niêm yết — và giá niêm yết đúng bằng GLM-5.2, với cửa sổ context gấp 4. Giá cached-input có công bố phía nguồn, nhưng bài đo lặp-nguyên-văn của chúng tôi chưa thấy lượt trúng cache nào trên model này — hãy coi nó là phần thưởng thêm, đừng đưa vào ngân sách. Giá live của cả chín model ở trang models, đồng bộ từ đúng database billing đang tính tiền request của bạn.

Số đo, không phải số chép

Bài đo của chính chúng tôi, 28/08/2026 — đúng ngày thêm model. Trạng thái live và số theo từng model nằm ở trang models.

~0,8 s

tới token đầu tiên (p50, 5 stream, không lượt nào treo)

~107 tok/s

tốc độ stream (p50)

72–77 ms / 1K token

tốc độ prefill đo ở cỡ input 50K–300K

~23 s

token đầu trên prompt 300K token thật — việc lớn hãy luôn dùng streaming

Chạy được chỉ với hai dòng config

Nếu code của bạn đã gọi API OpenAI, bạn chỉ đổi base_url và key. ID model là glm-5.3; ID nguồn công khai.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.clfaigateway.dev/v1",
    api_key="sk-gw-...",  # app.clfaigateway.dev
)

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module..."}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

GLM 5.3 trên gateway — câu hỏi thường gặp

Cửa sổ tính cả input lẫn ngân sách max_tokens. Ở cỡ này prefill là công việc thật — chúng tôi đo được 72–77 ms mỗi 1.000 token input từ cỡ 50K tới 300K, nên prompt 300K token mất chừng 23 giây mới ra token đầu. Request lớn hãy luôn stream, và chấp nhận lỗi hết công suất (retry được) lúc cao điểm với prompt rất lớn.

Docs context & cache →

Không — và chúng tôi kiểm chứ không đoán. Bài probe chuẩn gửi hai ảnh đặc màu; GLM 5.3 trả lời sai cả 0/2 — nhận ảnh xong rồi nói rằng nó không thấy được. Chính kiểu hỏng im lặng đó là lý do gateway từ chối request kèm ảnh tới model này ngay từ đầu bằng lỗi nêu đích danh, trước khi bạn mất tiền. Bốn model trong catalog đọc được ảnh — kiểm cùng một bài.

Model nào đọc được ảnh →

Cùng cửa sổ 1M, hai bài toán khác nhau. Bản full là model chủ lực của Z.ai cho code và agentic work — bài đo của chúng tôi ra ~107 token/s với token đầu 0,8 s; Flash rẻ hơn khoảng 9 lần ở chiều input và đọc được ảnh, đổi lại ~80 tok/s và token đầu chậm hơn. Một khác biệt API cụ thể chúng tôi va phải: hai model nhận hai bộ reasoning_effort khác nhau — bên này none/low/medium/high/max, Flash là low/medium/high/xhigh. Gateway validate theo từng model và nêu rõ các mức hợp lệ trong message lỗi.

Trang GLM 5.3 Flash →

Giá niêm yết phía nguồn trên mỗi triệu token giống hệt GLM-5.2 ở cả ba chiều — input, cached input, output — trong khi cửa sổ context tăng từ 262.144 lên 1.048.576 token. Cả hai model cùng hưởng giảm 40% dịp ra mắt ở đây, nên chọn GLM 5.3 không tốn thêm đồng nào trên mỗi token mà cửa sổ gấp bốn.

So giá live →

Dòng giá có công bố phía nguồn, nhưng trên model này, bài lặp nguyên văn prompt 300K token trong vòng một phút của chúng tôi vẫn tính 0 token cached — chưa thấy lượt hit nào, và chúng tôi công bố đúng điều đó thay vì hứa khoản tiết kiệm. Khi phía nguồn bắt đầu trúng cache, giá cached tự áp và usage log của bạn sẽ hiện rõ.

Cache hoạt động ra sao →

Chúng tôi thêm nó đúng ngày nó xuất hiện và tự đo mọi con số công bố — khoảng năm mươi lượt gọi, không lượt nào dính lỗi thoáng qua kiểu ngày đầu của Flash. Tín hiệu sớm tốt, nhưng chưa phải bảo chứng: gateway vẫn dịch trục trặc phía nguồn thành lỗi retry-được sạch sẽ và tự failover khi còn đường, và trang status sẽ nói thẳng nếu độ ổn định thay đổi.

Credits trả trước, tính theo token thật từ usage của nguồn — không bao giờ theo ước lượng. Token reasoning thuộc phần output và chỉ tính một lần. Mỗi request hiện đúng chi phí trong usage log, và sổ cái khớp tới từng nano-đô.

Docs billing →