Chuyển đến nội dung
tinAI
Quay lại

DeepSeek V4 Flash dẫn đầu Terminal-Bench 2.1 với harness công khai

antigma.ai · Loại nguồn: công ty/blog 2026-08-09T20:06:16.961Z
Bản dịch tiếng Việt của tinAI · Từ Ante Terminal Bench 2.1 Results | Coding Agent Benchmark (antigma.ai) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Ante Terminal Bench 2.1 Results | Coding Agent Benchmark (antigma.ai)

Tác giả: Ante

Ngày đăng: Dịch ngày:

TL;DR

Ante báo DeepSeek V4 Flash 0731 đạt 82,7% trên Terminal-Bench 2.1 với 368/445 trials pass. Điểm đáng chú ý không chỉ là vị trí số một, mà là mỗi kết quả có nguồn raw run hoặc PR để kiểm chứng.

Ước tính đọc: 2 phút

Có gì mới

Ante công bố bảng kết quả Terminal-Bench 2.1 cho coding agents, dùng cùng bộ 89 task, 5 trials mỗi task, timeout và giới hạn phần cứng chính thức. Dòng đứng đầu là DeepSeek V4 Flash 0731 chạy với Ante 0.preview.71, đạt 82,7% accuracy, tương ứng 368 lượt pass trên 445 trials.

Bảng cũng ghi cost và thời gian chạy: DeepSeek V4 Flash 0731 có cost 68,41 USD và thời gian trung bình 38,9 phút. Grok 4.5 đứng sau với 80,9%, cost 242,57 USD và 8,4 phút. Các dòng khác gồm GLM 5.2, DeepSeek V4 Pro, DeepSeek V4 Flash, MiMo V2.5, MiniMax M3 và Qwen3.6 27B.

Vì sao dev nên quan tâm

Terminal-Bench tập trung vào việc agent xử lý task trong terminal, nên nó gần với nhu cầu coding agent hơn nhiều benchmark hỏi đáp tổng quát. Điểm mạnh của trang này là các kết quả có liên kết tới raw Harbor run hoặc PR, giúp người đọc kiểm tra nguồn thay vì chỉ tin leaderboard.

Khi chọn model cho workflow nội bộ, dev không nên nhìn riêng accuracy. Cost, latency, agent harness, task set và khả năng audit đều ảnh hưởng đến quyết định. Một model đạt điểm cao nhưng chậm hoặc đắt có thể vẫn thua trong sản phẩm thật.

Cách đọc benchmark này

Benchmark tốt không thay thế eval nội bộ. Nó chỉ giảm lượng niềm tin mù mà bạn phải đặt vào một con số marketing.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Ante Terminal Bench 2.1 Results | Coding Agent Benchmark (antigma.ai) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: GitHub 1