Có gì mới
Roboflow benchmark GPT-5.6 Sol, Terra và Luna trên một VLM benchmark sắp công bố. Benchmark bao gồm object detection, counting, OCR và data extraction.
Kết quả rõ nhất nằm ở detection. GPT-5.5 đạt 13.8 mAP@50, còn GPT-5.6 Sol đạt 46.2. Terra và Luna cũng lên 44.7 và 43.3. Với counting, Sol đạt 73.0%, tăng từ 64.9% của GPT-5.5; Terra đạt 67.6%, Luna đạt 66.2%.
Roboflow cũng ghi một chi tiết thực dụng: GPT-5.6 cho kết quả tốt nhất khi prompt yêu cầu absolute XYXY coordinates theo pixel. Dùng sai format coordinate có thể làm giảm khoảng 15 điểm mAP trong benchmark của họ.
Giới hạn
OCR không phải phần nhảy vọt. Sol đạt mean similarity 90.7%, thấp hơn GPT-5.5 ở 91.2%. Text extraction còn giảm mạnh hơn: Sol 82.5%, GPT-5.5 87.6%.
Sol cũng không ổn định với ảnh khoảng 2,000 x 2,000 pixel trở lên, nhất là khi reasoning effort thấp. OpenAI xác nhận với Roboflow rằng tăng reasoning effort có thể giúp ổn định hơn, nhưng đổi lại token, latency và chi phí tăng. Cách workaround thực dụng là resize hoặc crop ảnh lớn trước khi gửi API.
Ý nghĩa với dev
GPT-5.6 đưa OpenAI gần hơn tới nhóm VLM dẫn đầu cho detection và counting, đặc biệt nếu bạn đang build UI agent, document workflow hoặc visual QA.
Nhưng bài viết không nói rằng Sol là lựa chọn mặc định cho mọi workload. Roboflow đo Sol khoảng 10 giây mỗi ảnh và khoảng 2.5 cent mỗi ảnh. Gemini 3.5 Flash vẫn được họ đánh giá là lựa chọn thực dụng hơn cho detection/counting khối lượng lớn vì giá thấp hơn và kết quả mạnh trong benchmark này.
Nếu workload của bạn là batch nhiều ảnh, hãy benchmark theo ảnh thật, prompt thật, coordinate format thật và giá thật. Nếu workload là agent cần hiểu màn hình hoặc document layout, GPT-5.6 Sol đáng đưa vào vòng thử nghiệm.