Luận điểm chính
Bài viết cho rằng model nhỏ, nhanh và rẻ đã vượt qua ngưỡng “đủ tốt” cho nhiều tác vụ sản phẩm. Tác giả vẫn chọn model mạnh nhất cho coding hoặc bài toán cần đột phá, nhưng nhận thấy một lớp workload lớn không cần trả chi phí frontier ở mọi request.
Trải nghiệm được nêu trong bài là GPT-5.6 Luna chạy khoảng 100 token mỗi giây và có thể xử lý các luồng nghiên cứu trên hàng nghìn email với chi phí chỉ vài chục cent. Đây là quan sát từ workload cá nhân, không phải benchmark chuẩn hóa, nhưng nó đặt đúng câu hỏi: một model có tạo đủ giá trị trên mỗi request để business model tồn tại hay không?
Khi inference cost quyết định sản phẩm
Ứng dụng consumer truyền thống có thể phục vụ thêm người dùng với marginal cost thấp rồi kiếm tiền từ quảng cáo hoặc subscription. Tính năng AI đảo bài toán đó vì mỗi lượt dùng đều phát sinh inference cost.
Tác giả dùng một eval cá nhân: yêu cầu model nghiên cứu sở thích của mình, tìm tin từ Hacker News, Reddit, Twitter và dựng một microsite tin tức hằng ngày. Với model lớp Sonnet trước đó, một lần chạy tốn khoảng 1 USD. Luna cho kết quả được tác giả đánh giá là khá ổn ở mức trung bình khoảng 0,10 USD. Chênh lệch 10 lần này có thể biến một tính năng subscription bất khả thi thành thứ đáng thử nghiệm.
Dev không nên đọc hai con số như benchmark chung cho mọi agent. Search depth, context, tool call, cache và tiêu chí chất lượng đều ảnh hưởng chi phí. Cách dùng hữu ích là lấy chính workflow của sản phẩm, định nghĩa output chấp nhận được rồi so sánh cost trên mỗi output đạt chuẩn.
Hai loại công việc trong tổ chức
Bài viết chia công việc thành hai nhóm:
- Công việc “IQ 180”, nơi một lời giải mới hoặc hiểu biết sâu quyết định kết quả.
- Công việc “token spewer”, nơi giá trị đến từ phản hồi nhanh, theo sát nhiều luồng và liên tục đẩy việc tiến lên.
Peter, đồng sáng lập Segment cùng tác giả, ước tính khoảng 95% công việc của mình thuộc nhóm thứ hai: họp, nhắc việc và phối hợp. Đây là một giai thoại, không phải phép đo toàn thị trường. Tuy vậy, nó giải thích vì sao model nhỏ có thể có demand lớn ngay cả khi model frontier tiếp tục mạnh hơn: nhiều quy trình cần throughput và reliability hơn là một lời giải xuất sắc hiếm hoi.
Harness quan trọng không kém model
Model rẻ không tự biến thành hệ thống đáng tin cậy. Bài viết chỉ ra các phần còn thiếu để dùng trong business:
- Harness chia task và kiểm tra output.
- Phòng chống prompt injection.
- Role và permission rõ ràng.
- Cơ chế chọn model mạnh hơn khi uncertainty hoặc error cost tăng.
World knowledge ít hơn cũng có thể làm tăng hallucination, còn model “đủ tốt” cho text không mặc nhiên đủ tốt cho tool use. Vì vậy, routing nên dựa trên loại lỗi chấp nhận được, không chỉ latency hoặc giá token.
Ý nghĩa với Dev
Đừng thay toàn bộ stack bằng model nhỏ chỉ vì một bảng giá. Hãy bắt đầu với tác vụ lặp lại, output dễ kiểm tra và có fallback: phân loại, extraction, nháp, truy vấn nội bộ hoặc bước con trong agent loop. Giữ model mạnh cho quyết định khó, đồng thời log quality, latency và cost theo cùng một eval. Khi model nhỏ thắng trên cost mỗi kết quả đạt chuẩn, đó mới là lợi thế sản phẩm thật.