Tin nổi bật
OpenAI muốn đo ROI của AI bằng công việc hoàn tất, không phải token rẻ · 7 phút https://openai.com/index/a-scorecard-for-the-ai-age
Token rẻ nghe vui cho bảng tính, nhưng OpenAI đang nhắc lại một điểm mà đội làm agents hay bỏ qua: chi phí thật nằm ở task thành công. Nếu model rẻ phải retry ba lần, kéo thêm human review, rồi vẫn fail test, hóa đơn API thấp không cứu được sprint. Phần thực dụng nhất là bộ ba trạng thái “ready to use”, “needs correction”, “needs escalation”; log được ba nhãn này trong workflow coding/support/legal là bạn bắt đầu đo được AI có làm giảm việc thật hay chỉ tạo thêm hàng đợi review. Bài viết cũng gài khá nhiều thông tin sản phẩm: OpenAI nói GPT-5.6 Sol đạt 72,7% trên DeepSWE v1.1 và thấp hơn 36,2% chi phí API ước tính so với Claude Fable 5, nhưng cứ chờ benchmark độc lập trước khi đem số này vào slide bán hàng nội bộ.
Models & Tools
Research & Insights
— tinAI