Tin nổi bật
RTK báo cắt 89% token, nhưng hóa đơn agent không nghe theo
https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/
Quesma chi hơn 1.500 USD cho 1.740 lượt Terminal-Bench 2.1 để kiểm tra lớp nén output terminal được quảng bá tiết kiệm 60–90% token. Kết quả thực dụng hơn dashboard: tổng chi phí Fable giảm 5%, DeepSeek tăng 5%; tính trung bình từng task, Fable đắt hơn 1% với khoảng tin cậy còn chạm zero, DeepSeek đắt hơn 17%. Trong khi đó, rtk gain báo tiết kiệm 349,2 triệu token, hay 89%, vì lấy số byte output bị lọc chia bốn và bỏ qua các lượt agent phát sinh. Một rewrite lệnh find không được hỗ trợ tạo 339 lỗi liên tiếp, khiến một lượt chạy đắt khoảng chín lần baseline. gillesjacobs chỉ ra chi tiết bị chôn sâu: gần như toàn bộ mức giảm của Fable đến từ một task. Mình không kết luận RTK vô dụng; output ngắn chưa phải cost metric. Làm ngay. Đo chi phí trên task pass, số lượt và chất lượng kết quả trước khi rewrite mọi shell call.
Toán học không chỉ là máy giải bài
25 Fields Medalist cảnh báo benchmark nhắm sai mục tiêu. Bản tuyên bố Math and AI coi lời giải là proxy cho hiểu biết; công bố vội có thể làm hỏng ghi nhận công lao và chuỗi truyền đạt ý tưởng. jeremysalwen phản biện: AI có thể phá thước đo đóng góp, chưa chắc phá khả năng hiểu. Phân biệt này đúng với benchmark agent, nên mình đọc kỹ.
“Ít code” vẫn cần một benchmark lợi ích
litelm rút routing LLM xuống khoảng 2.900 dòng và hai dependency. Repo alpha giữ streaming, tool use, embedding và route 19 provider, nhưng bỏ proxy, cache, budget và cost tracking; nhiều provider chưa được verify. freshtake hỏi đúng chỗ trống: latency hoặc memory giảm bao nhiêu? Mình sẽ đọc lướt, chưa đổi dependency chỉ vì đếm ít dòng hơn.
Cả ba nguồn cùng nhắc một việc: tối ưu proxy thì dễ; chứng minh giá trị end-to-end mới khó.
— Tin