Model nào thật sự đọc được ảnh
Trang model ghi “Vision” không phải là bằng chứng. Chúng tôi gửi cho mọi model trong catalog cùng hai tấm ảnh và hỏi trong ảnh có gì — câu trả lời chia đôi catalog. Ba model đọc được ảnh và được bán đúng như vậy; bốn model còn lại thì không, và được đánh dấu đúng như thế, nên request kèm ảnh bị từ chối trước khi tốn của bạn đồng nào.
Kết quả từng model
- qwen3.8-27b
- Đọc được ảnh — nhận đúng cả hai ảnh probe
- kimi-k2.6
- Đọc được ảnh — nhận đúng cả hai ảnh probe
- kimi-k2.7-code
- Đọc được ảnh — nhận đúng cả hai ảnh probe
- glm-5.2
- Không — nhận ảnh, trả lời “Unknown”, rồi rỗng
- glm-4.7-flash
- Không — từ chối ảnh thẳng thừng, kiểu hỏng trung thực
- deepseek-v4-pro
- Không — nhận ảnh rồi trả về rỗng hoàn toàn
- deepseek-v4-flash
- Không — nhận ảnh, trả lời “unknown” cả hai lần
Ba model đọc được ảnh (giảm 40% niêm yết)
- Input
$0,45$0,27- Output
$3,20$1,92
@cf/qwen/qwen3.8-27b
- Input
$0,95$0,57- Output
$4,00$2,40
@cf/moonshotai/kimi-k2.6
- Input
$0,95$0,57- Output
$4,00$2,40
@cf/moonshotai/kimi-k2.7-code
Ảnh tính như token input theo giá thường của từng model — không phụ phí riêng. Giá live của cả bảy model ở trang models.
Ba kiểu một model hỏng ở khoản nhìn ảnh
Bài probe của chúng tôi, 18/08/2026. Kiểu ở giữa mới là kiểu đắt: không lỗi, tính toán vẫn tốn thật, câu trả lời nghe xuôi tai nhưng chẳng dựa trên ảnh của bạn.
3 trên 7
model thật sự đọc được ảnh
Im lặng
nhận ảnh, lờ đi, vẫn tính tiền bạn
Rõ ràng
từ chối ảnh thẳng — kiểu hỏng đáng mong đợi
0 request
chúng tôi để lọt tới model mù kèm ảnh
Gửi một tấm ảnh
Cùng một lời gọi cho cả ba: mảng content gồm phần chữ và một base64 data URI. Link http(s) không được tải về.
import base64
from openai import OpenAI
client = OpenAI(
base_url="https://api.clfaigateway.dev/v1",
api_key="sk-gw-...", # app.clfaigateway.dev
)
with open("screenshot.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
resp = client.chat.completions.create(
model="qwen3.8-27b",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "What does this screen show?"},
# Must be a data: URI. Remote http(s) links are not fetched.
{"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{b64}"}},
],
}],
# Leave room: the model thinks before it answers, and a tiny budget
# can be spent entirely on reasoning, returning empty content.
max_completion_tokens=400,
)
print(resp.choices[0].message.content)Vision trên gateway — câu hỏi thường gặp
Vì khả năng ghi trên trang model mô tả bộ trọng số được thiết kế để làm gì, chứ không mô tả endpoint đang phục vụ làm gì với request của bạn hôm nay. Hai model được quảng cáo là có vision đã nhận ảnh của chúng tôi rồi trả lời như chưa từng nhìn thấy. Chúng tôi công bố đúng thứ bài probe của mình trả về, và chạy lại mỗi lần thêm model mới.
Xem khả năng từng model →Chúng tôi đánh dấu khả năng đọc ảnh cho từng model theo kết quả probe, và gateway từ chối đầu vào ảnh trên mọi model không được đánh dấu — một lỗi 400 trước khi request đi lên upstream, không tốn của bạn gì. Kiểu hỏng chúng tôi phòng chính là kiểu im lặng: model nhận ảnh, lờ đi, tự tin trả lời dựa trên phần chữ, và tính tiền bạn đủ.
Tra cứu lỗi →qwen3.8-27b rẻ nhất trong ba và mới nhất. kimi-k2.6 là bản đa dụng cân bằng, kimi-k2.7-code tinh chỉnh cho việc code quy mô cả repo — cả hai cùng cửa sổ 262K. Cả ba nhận cùng một dạng request, nên đổi thử model khác chỉ là sửa một từ.
So giá →Chữ nhỏ, tài liệu scan và biểu đồ dày đặc. Bài probe của chúng tôi chứng minh model thật sự đọc tấm ảnh được đưa — nó không chứng minh chất lượng OCR, nên chúng tôi không bán OCR. Nếu bạn cần thứ đó, hãy thử trên chính tài liệu của mình trước; request hỏng không sinh ra gì thì $0.
Hướng dẫn gửi ảnh →