Bỏ qua, tới nội dung chính
← Tất cả bài viết
Sản phẩm

Chúng tôi bắt mọi model nhìn một tấm ảnh. Ba con nhìn được.

Đọc 5 phút

Hôm nay gateway thêm qwen3.8-27b — Qwen 3.8 27B của Alibaba, cửa sổ context 262.144 token, có tool calling và nhận ảnh. Model vào luôn chương trình ra mắt giảm 40% giá niêm yết, tự áp. Đó là phần thông báo. Phần đáng đọc hơn là thứ chúng tôi phát hiện trên đường làm nó.

Câu chúng tôi suýt đăng

Bản nháp đầu của trang này viết Qwen là model DUY NHẤT trong catalog thật sự đọc được ảnh. Câu đó nghe hay. Nó cũng SAI, và chúng tôi bắt được trước giờ đăng khoảng một tiếng — không phải nhờ nghĩ kỹ hơn, mà nhờ đem bài kiểm chạy trên MỌI model thay vì chỉ con đang hào hứng.

Hai model Kimi đã được đánh dấu là có vision trong catalog của chúng tôi từ ngày đầu, chép theo trang model của chúng. Chưa ai từng gửi cho chúng một tấm ảnh. Nên trước khi viết một câu so sánh nhất, chúng tôi gửi ảnh cho cả bảy.

Bài kiểm

Cố tình làm thô: hai tấm ảnh, một đỏ đặc, một xanh lá đặc, sinh ngay trong bài kiểm để không phụ thuộc file ngoài hay một lượt tải mạng. Câu hỏi là "màu chủ đạo của ảnh này là gì?" và model phải đúng cả hai. Một tấm thì chẳng chứng minh được gì — model không nhìn thấy gì vẫn đoán trúng "đỏ" một tỷ lệ kha khá.

Ba con đọc được ảnh. Bốn con thì không.

  • `qwen3.8-27b` — đọc được ảnh. Đúng cả hai lượt probe, và đó là lý do chúng tôi bán nó như một model vision.
  • `kimi-k2.6` — đọc được ảnh. Đúng cả hai lượt. Catalog trước đó đúng nhờ may; giờ đúng nhờ đo.
  • `kimi-k2.7-code` — đọc được ảnh. Đúng cả hai lượt.
  • `glm-5.2` — không. Nhận ảnh không kêu ca gì, trả lời "Unknown", rồi trả về rỗng.
  • `deepseek-v4-pro` — không. Nhận ảnh rồi trả về câu rỗng, cả hai lượt, sau khi tính toán nhiều nhất bàn.
  • `deepseek-v4-flash` — không. Nhận ảnh và trả lời "unknown" cả hai lượt.
  • `glm-4.7-flash` — không, và nói thẳng. Từ chối request ngay bằng một lỗi rõ ràng, ghi rằng nó không phải model đa phương thức.

Kiểu hỏng ở giữa mới là kiểu đắt tiền

Nhìn hình dáng danh sách trên. Một model từ chối sạch sẽ. Ba model nhận ảnh, tiêu tính toán thật, rồi vẫn trả lời — chỉ dựa vào phần chữ, không một dấu hiệu nào cho biết tấm ảnh đã bị bỏ qua. Hành vi thứ hai đó tệ hơn một lỗi ở mọi khía cạnh quan trọng: bạn bị tính tiền đủ, bạn nhận một câu trả lời trôi chảy, và không gì trong response nói cho bạn biết đó là phỏng đoán. Một message lỗi thì không tốn của bạn đồng nào và mất ba mươi giây để xử lý.

Vì vậy gateway của chúng tôi nay từ chối đầu vào ảnh trên mọi model không được đánh dấu có vision — lỗi 400 trước khi request đi lên upstream, tính $0. Chúng tôi thà đưa bạn một lời từ chối bạn xử lý được, còn hơn một đoạn văn tự tin về tấm ảnh chẳng ai nhìn.

Gửi một tấm ảnh thế nào

Hình dạng đúng thứ SDK OpenAI vốn đã chờ: một mảng content gồm phần text và phần image_url. Chỉ một luật quyết định lần thử đầu của bạn có chạy hay không — ảnh phải nhúng thẳng dạng base64 data URI. Link http(s) không được tải về, và chúng tôi từ chối ngay từ đầu thay vì để nó hỏng ở tầng sâu hơn.

python
import base64
from openai import OpenAI

client = OpenAI(base_url="https://api.clfaigateway.dev/v1", api_key="sk-gw-...")

with open("screenshot.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

resp = client.chat.completions.create(
    model="qwen3.8-27b",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "What does this screen show?"},
            {"type": "image_url",
             "image_url": {"url": f"data:image/png;base64,{b64}"}},
        ],
    }],
    max_completion_tokens=400,   # chừa chỗ cho phần suy luận
)
print(resp.choices[0].message.content)

Đo được gì trên Qwen, và CHƯA đo gì

  • Cửa sổ context 262.144 token, xác nhận thẳng với endpoint chứ không chép từ trang giới thiệu.
  • ~1,1 giây ra token đầu với prompt ngắn. Phần chậm là prefill: cỡ 165–195 ms mỗi 1.000 token input, chậm hơn vài lần dòng DeepSeek Flash của chúng tôi — prompt 150K token mất khoảng 28 giây trước khi câu trả lời bắt đầu, dù byte đầu tiên về sau ~1,9 giây.
  • Tool calling đã kiểm chứng — sáu trên sáu contract test, tool được gọi đúng schema.
  • Không có giảm giá cached input. Prefix cache chưa hoạt động trên model này trong bài đo của chúng tôi, nên chúng tôi để giá cached bằng giá input thường thay vì quảng cáo một khoản tiết kiệm sẽ không tới.
  • CHƯA đo: chữ nhỏ, tài liệu scan, biểu đồ dày đặc. Bài probe cho thấy model đọc được tấm ảnh nó nhận. Nó không chứng minh chất lượng OCR, nên chúng tôi không bán OCR.

Giá

Trong dịp ra mắt, qwen3.8-27b tính $0.27 / $1.92 mỗi 1M token (input/output, niêm yết $0.45 / $3.20). Ảnh tính như token input theo giá thường — không có phụ phí riêng cho ảnh. Giá đang bán và giá niêm yết gạch ngang đều nằm trên trang models, đồng bộ từ đúng database billing đang tính tiền request của bạn.

ID model giữ nguyên như bản gốc và endpoint chuẩn OpenAI, nên dùng nó chỉ là một base_url cộng một cái key: đăng ký ở app.clfaigateway.dev, nạp VietQR hoặc thẻ quốc tế, rồi gửi tấm ảnh đầu tiên. Chi tiết ở /vi/qwen3-8-27b-api, /vi/qwen3-8-27b-vision/vi/vision-api.

Câu hỏi thường gặp

Model nào trên gateway đọc được ảnh?

Ba: qwen3.8-27b, kimi-k2.6 và kimi-k2.7-code. Mỗi con đều do chính chúng tôi probe xác nhận, không phải đọc trang model rồi chép. Bốn model còn lại bị gateway từ chối đầu vào ảnh, không tốn của bạn đồng nào.

Tôi gửi ảnh bằng URL được không?

Không. Ảnh phải nhúng dạng base64 data URI; link http(s) không được tải về. Chúng tôi từ chối URL ngay từ đầu bằng một lỗi rõ ràng thay vì để nó hỏng ở upstream.

Nó có OCR được tài liệu scan không?

Chúng tôi chưa đo, nên không tuyên bố. Bài probe chứng minh model thật sự đọc tấm ảnh nó nhận — không chứng minh nó xử tốt chữ nhỏ hay biểu đồ dày. Hãy thử trên chính tài liệu của bạn; request hỏng không sinh ra gì thì $0.

Giảm 40% kéo dài bao lâu?

Trong dịp ra mắt, áp cho cả catalog. Giá live trên trang models luôn là giá được tính.