Tin nổi bật
Claude Fable 5.1 giảm giá đúng chỗ agent đốt tiền
https://www.anthropic.com/claude-fable-and-mythos-5-1
Claude Fable 5.1 giữ giá input/output ở mức 10/50 USD cho một triệu token, nhưng hạ giá cache read 75% xuống 0,25 USD. Anthropic ước tính thay đổi này giảm khoảng 25% tổng chi phí với workload thường và tới 45% với agent nhiều bước. Hãng cũng báo điểm Terminal-Bench-Science tăng từ 24,7% lên 52,6%, song đây vẫn là eval do nhà cung cấp chạy, với sai số chuẩn 3,5–4,5 điểm. simonw chỉ ra phần dễ kiểm chứng và hữu ích hơn: agent dài có thể dùng lại transcript đã cache ở các lượt sau, nên mức giảm chạm thẳng vào hóa đơn. Fable được mở đại trà; Mythos là cùng model nhưng có safeguards phù hợp hơn cho người dùng cyber và life sciences đã qua xét duyệt. Mình xem đây là một lần nâng cấp đáng thử lại trên trace thật, không phải lý do tin trọn bảng benchmark. Nếu đang route Claude, mình khuyên replay cùng task, effort và cache-hit rate trước khi đổi model mặc định.
Một benchmark cần đọc đúng phạm vi
Transformer nhỏ đạt 44% ARC-1 với 67 xu. Bài viết mô tả model được train từ đầu trong 1,5 giờ trên RTX 5090, đạt thêm 7% trên ARC-2. Ablation cho thấy 3D RoPE và embedding riêng theo task tạo phần lớn mức tăng. Mình giữ cảnh báo của embedding-shape: đây là hệ chuyên giải ARC, chưa phải bằng chứng về model tổng quát.
Tool đáng để thử có kiểm soát
Keenable SELECT đưa web search vào SQL. Showcase cho thấy một MCP tool chạy SELECT read-only trên DuckDB, lọc chính xác trước rồi mới gọi các toán tử semantic để trích xuất dữ liệu web. Mình thích việc nó lưu result set và toàn bộ trajectory để audit; nhưng các hàm semantic vẫn là phán đoán của model, nên báo cáo cần giữ link nguồn và bước verify riêng.
Giá rẻ hơn, benchmark nhỏ hơn và query rõ hơn đều có ích khi chúng làm bằng chứng dễ kiểm tra hơn.
— Tin