Có gì mới
Ante công bố bảng kết quả Terminal-Bench 2.1 cho coding agents, dùng cùng bộ 89 task, 5 trials mỗi task, timeout và giới hạn phần cứng chính thức. Dòng đứng đầu là DeepSeek V4 Flash 0731 chạy với Ante 0.preview.71, đạt 82,7% accuracy, tương ứng 368 lượt pass trên 445 trials.
Bảng cũng ghi cost và thời gian chạy: DeepSeek V4 Flash 0731 có cost 68,41 USD và thời gian trung bình 38,9 phút. Grok 4.5 đứng sau với 80,9%, cost 242,57 USD và 8,4 phút. Các dòng khác gồm GLM 5.2, DeepSeek V4 Pro, DeepSeek V4 Flash, MiMo V2.5, MiniMax M3 và Qwen3.6 27B.
Vì sao dev nên quan tâm
Terminal-Bench tập trung vào việc agent xử lý task trong terminal, nên nó gần với nhu cầu coding agent hơn nhiều benchmark hỏi đáp tổng quát. Điểm mạnh của trang này là các kết quả có liên kết tới raw Harbor run hoặc PR, giúp người đọc kiểm tra nguồn thay vì chỉ tin leaderboard.
Khi chọn model cho workflow nội bộ, dev không nên nhìn riêng accuracy. Cost, latency, agent harness, task set và khả năng audit đều ảnh hưởng đến quyết định. Một model đạt điểm cao nhưng chậm hoặc đắt có thể vẫn thua trong sản phẩm thật.
Cách đọc benchmark này
- Xem accuracy là tín hiệu ban đầu, không phải kết luận cuối.
- So sánh cả cost và runtime giữa các dòng.
- Mở raw run hoặc PR nếu kết quả sẽ ảnh hưởng đến quyết định mua hoặc routing model.
- Tự chạy task đại diện cho codebase của bạn trước khi chuẩn hóa model.
Benchmark tốt không thay thế eval nội bộ. Nó chỉ giảm lượng niềm tin mù mà bạn phải đặt vào một con số marketing.