Giới thiệu
Bài viết bắt đầu từ một vấn đề rất thực tế: hóa đơn token cho coding agent đang tăng nhanh khi team giao nhiều việc hơn cho AI. API frontier model dễ dùng, nhưng khi usage đủ lớn hoặc dữ liệu đủ nhạy cảm, self-host inference bắt đầu đáng để tính.
Thay vì chỉ đo tokens/second, nhóm tác giả đo theo đơn vị sát workflow hơn: một task coding có được hoàn thành không, mất bao lâu, và bao nhiêu concurrent session còn chấp nhận được trước khi developer thấy quá chậm. Workload dùng khoảng 100 run trên 64 task từ SWEBench Pro.
Kết quả Kimi K3
Bản cập nhật ngày 2026-07-29 thêm Kimi K3 vào cùng setup. Kimi K3 có 2.8T parameters và khoảng 1.4TB weights, nên không fit thoải mái trong node 8xB200 vì 1.5TB HBM không còn đủ headroom cho KV cache. Nhóm test phải dùng node 8xB300 với 288GB HBM mỗi GPU, tổng 2.3TB HBM, làm hardware cost cao hơn khoảng 20% tùy nhà cung cấp.
Trong run của họ, Kimi K3 phục vụ 16 concurrent session. GLM-5.2 trước đó đạt 24 session trong cùng phân tích. Aggregate throughput của Kimi K3 khoảng 122 tok/s ở 16 user, thấp hơn GLM-5.2 khoảng 30%, và median task time là 38 phút so với 26 phút.
Điểm bù lại nằm ở chất lượng: Kimi K3 resolve 86.4% task trong subset, cao hơn 24 điểm phần trăm so với GLM-5.2 và Opus 4.8, cả hai ở mức 62.5%. Caveat rất quan trọng: task SWEBench Pro trong subset có thể đã nằm trong training data của Kimi, nên con số 86.4% nên được xem là upper bound.
Các cấu hình được so sánh
Bài viết đặt nhiều model vào các tier phần cứng khác nhau: Qwen3.6-35B-A3B-FP8 trên DGX Spark hoặc H200, DeepSeek-V4-Flash trên 4xH200, GLM-5.2 trên 8xB200, và Kimi K3 trên 8xB300. Với mỗi cấu hình, nhóm đo throughput tổng, thời gian hoàn thành task, concurrency thoải mái và chi phí theo buy, rent hoặc API.
Một kết luận đáng giữ lại là GPU riêng không tự động rẻ nếu utilization thấp. Bạn trả tiền cho pool 24/7, trong khi nhu cầu token của developer thường tăng theo giờ làm việc, nghỉ trưa, rồi lên lại buổi chiều. Nếu không có workload agent chạy ngoài giờ để lấp capacity, chi phí thật sẽ xấu hơn spreadsheet peak-load.
Ý nghĩa với Dev
Self-hosting coding agent không phải câu hỏi mua GPU nào mạnh nhất. Nó là bài toán kết hợp giữa model quality, memory, KV cache, inference engine, concurrency, task latency và mức độ nhạy cảm dữ liệu. Một model rẻ hơn trên mỗi token vẫn có thể đắt nếu cần nhiều turn hơn để xong việc. Một model tốt hơn vẫn có thể không dùng được nếu median task time làm developer bỏ cuộc.
Team nên benchmark bằng task nội bộ thay vì chỉ đọc bảng xếp hạng model. Nếu task của bạn giống sửa bug dài, refactor nhiều file hoặc đọc codebase lớn, hãy đo task completion và thời gian end-to-end. Nếu task chủ yếu là completion, hỏi đáp nhỏ hoặc generate snippet, phần cứng thấp hơn và model nhỏ hơn có thể đủ tốt.
Điều cần giữ lại
Bài viết hữu ích vì nó ép self-hosting về ngôn ngữ vận hành: bao nhiêu session, bao nhiêu phút, bao nhiêu token, bao nhiêu tiền, và caveat nào làm số đẹp bớt đẹp. Kimi K3 có tín hiệu chất lượng mạnh, nhưng cái giá là memory lớn, throughput thấp hơn và cần kiểm chứng trên workload không nằm trong training data.