Chuyển đến nội dung
tinAI
Quay lại

GPT-5.6 Sol: vision của OpenAI tốt hơn rõ rệt, nhưng batch vẫn phải tính giá

blog.roboflow.com · Loại nguồn: web 2026-08-17T20:46:21.793Z
Bản dịch tiếng Việt của tinAI · Từ GPT 5.6 Sol is the best "vision" model OpenAI ever released (blog.roboflow.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: GPT 5.6 Sol is the best "vision" model OpenAI ever released (blog.roboflow.com)

Tác giả: Roboflow

Ngày đăng: Dịch ngày:

TL;DR

Roboflow đo GPT-5.6 Sol tăng mạnh ở object detection và counting so với GPT-5.5, nhưng OCR gần như đi ngang và extraction còn thấp hơn. Sol đáng thử cho UI agent và document workflow, nhưng batch lớn vẫn cần so giá, latency và benchmark riêng.

Ước tính đọc: 2 phút

Có gì mới

Roboflow benchmark GPT-5.6 Sol, Terra và Luna trên một VLM benchmark sắp công bố. Benchmark bao gồm object detection, counting, OCR và data extraction.

Kết quả rõ nhất nằm ở detection. GPT-5.5 đạt 13.8 mAP@50, còn GPT-5.6 Sol đạt 46.2. Terra và Luna cũng lên 44.7 và 43.3. Với counting, Sol đạt 73.0%, tăng từ 64.9% của GPT-5.5; Terra đạt 67.6%, Luna đạt 66.2%.

Roboflow cũng ghi một chi tiết thực dụng: GPT-5.6 cho kết quả tốt nhất khi prompt yêu cầu absolute XYXY coordinates theo pixel. Dùng sai format coordinate có thể làm giảm khoảng 15 điểm mAP trong benchmark của họ.

Giới hạn

OCR không phải phần nhảy vọt. Sol đạt mean similarity 90.7%, thấp hơn GPT-5.5 ở 91.2%. Text extraction còn giảm mạnh hơn: Sol 82.5%, GPT-5.5 87.6%.

Sol cũng không ổn định với ảnh khoảng 2,000 x 2,000 pixel trở lên, nhất là khi reasoning effort thấp. OpenAI xác nhận với Roboflow rằng tăng reasoning effort có thể giúp ổn định hơn, nhưng đổi lại token, latency và chi phí tăng. Cách workaround thực dụng là resize hoặc crop ảnh lớn trước khi gửi API.

Ý nghĩa với dev

GPT-5.6 đưa OpenAI gần hơn tới nhóm VLM dẫn đầu cho detection và counting, đặc biệt nếu bạn đang build UI agent, document workflow hoặc visual QA.

Nhưng bài viết không nói rằng Sol là lựa chọn mặc định cho mọi workload. Roboflow đo Sol khoảng 10 giây mỗi ảnh và khoảng 2.5 cent mỗi ảnh. Gemini 3.5 Flash vẫn được họ đánh giá là lựa chọn thực dụng hơn cho detection/counting khối lượng lớn vì giá thấp hơn và kết quả mạnh trong benchmark này.

Nếu workload của bạn là batch nhiều ảnh, hãy benchmark theo ảnh thật, prompt thật, coordinate format thật và giá thật. Nếu workload là agent cần hiểu màn hình hoặc document layout, GPT-5.6 Sol đáng đưa vào vòng thử nghiệm.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ GPT 5.6 Sol is the best "vision" model OpenAI ever released (blog.roboflow.com) · Loại nguồn: web và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: web 1