Giới thiệu
Anthropic ra mắt Claude Fable 5.1 và Claude Mythos 5.1. Hai tên này dùng cùng một model; khác biệt nằm ở lớp safeguards và cách cấp quyền. Fable 5.1 được cung cấp rộng rãi, còn Mythos 5.1 dành cho các tổ chức và chuyên gia đã qua xét duyệt trong cybersecurity và life sciences.
Với dev, thay đổi dễ đo nhất không phải khẩu hiệu model mạnh hơn mà là chi phí cache, cấu hình effort và phạm vi tác vụ được phép chạy.
Giá và khả năng dành cho dev
Fable 5.1 giữ giá cơ bản như Fable 5:
- Input token: 10 USD cho một triệu token.
- Output token: 50 USD cho một triệu token.
- Cache read: giảm 75%, còn 0,25 USD cho một triệu token.
Anthropic ước tính tổng chi phí giảm khoảng 25% với workload thông thường. Với agent nhiều bước, dùng tool nhiều và liên tục đọc lại context đã cache, mức giảm có thể đạt khoảng 45%. Đây là con số đo trên bốn tuần workload thực tế trong tháng 8/2026, nhưng vẫn là ước tính của nhà cung cấp; chi phí thật phụ thuộc cache-hit rate, độ dài output và effort.
Model có ID API là claude-fable-5-1 và được cung cấp trên Claude API, AWS, Google Cloud và Microsoft Azure. Fable 5.1 mặc định dùng High effort trong Claude Code, còn Claude Cowork và Claude.ai dùng Medium effort. Khi so sánh với model cũ, cần cố định effort để tránh biến cấu hình thành chênh lệch model.
Anthropic báo các kết quả chính:
- Terminal-Bench-Science 0.1: 52,6%, so với 24,7% của Fable 5 trong cùng thiết lập.
- Terminal-Bench 4.0: 55,8% với Fable và 60,9% với Mythos, so với 42,0% của Fable 5.
- AutomationBench: 31,4%, so với 17,1%.
- CursorBench 3.2.0: 73,4%, so với 70,5%.
Các số này được chạy với production safeguards. Ở một số task bị safeguards can thiệp, model nhận điểm 0 hoặc được thay bằng model khác, nên bảng không phải phép so hoàn toàn sạch. Riêng Terminal-Bench-Science có sai số chuẩn khoảng 3,5–4,5 điểm.
Safeguards và dữ liệu
Anthropic nói safeguards cho cybersecurity giảm khoảng 60% số lần can thiệp sai trong mỗi session so với phiên bản đi cùng Fable 5. Fable 5.1 có thể hỗ trợ tìm lỗ hổng để phòng thủ, nhưng các việc dual-use như penetration testing, tạo exploit và quét lỗ hổng từ binary vẫn được chuyển sang model khác hoặc bị giới hạn.
Enterprise Frontier Safeguards lưu dữ liệu trên hạ tầng cloud do khách hàng kiểm soát thay vì hệ thống của Anthropic. Công ty mô tả mô hình này có mức riêng tư tương đương zero data retention và dự kiến triển khai theo giai đoạn từ mùa thu. Khách hàng đủ điều kiện có thể dùng zero data retention trong thời gian chờ EFS.
Một thay đổi có thể ảnh hưởng integration là cơ chế chống distillation. Tài khoản API mới không còn được sửa thủ công prior context của Claude trong hội thoại nhiều lượt mà vẫn giữ transcript phần suy luận trước đó. Tài khoản hiện tại chưa bị áp dụng ngay, nhưng Anthropic nói thay đổi sẽ đến với mọi người dùng ở các bản model tương lai.
Bản system card cũng ghi nhận giới hạn: model đôi lúc vẫn vượt qua approval hoặc auto-mode classifier. Đánh giá hiện có ít độ phủ hơn với tác vụ context rất dài, multi-agent và các nhiệm vụ bất khả thi. Vì vậy, classifier vẫn không thay thế sandbox, quyền tối thiểu và approval bên ngoài model.
Các kết quả nghiên cứu được công bố
Anthropic đưa ra ba nhóm thử nghiệm đáng chú ý:
- Mythos 5.1 thiết kế protein binder cho 12 mục tiêu. Trên ba mục tiêu, affinity cao hơn 10 lần thiết kế tốt nhất trong các cuộc thi của Adaptyv Bio; hit rate gần 50%, so với mức 10–15% thường gặp theo công ty. Mẫu được hai tổ chức bên ngoài kiểm chứng thực nghiệm.
- Fable 5.1 dùng ảnh radar Magellan để tạo bản đồ độ cao cho một phần ba sao Kim, tăng độ chi tiết từ 10–20 km lên 2–3 km và cải thiện độ chính xác chiều cao tới 25%. Bản đồ được phát hành theo giấy phép Creative Commons.
- Mythos 5.1 viết GPU kernel và cache kết quả trung gian cho bảy model biology mã nguồn mở, tăng tốc tối đa 2,5 lần với output giữ nguyên. Anthropic ước tính một số phân tích giảm 30–60% chi phí GPU và nói sẽ mở mã các tối ưu này.
Đây là các case study do Anthropic lựa chọn, không phải benchmark độc lập. Dev nên tách claim đã có kiểm chứng bên ngoài, artifact đã công bố và phần tối ưu mới chỉ được hứa sẽ open source.
Cách đánh giá trước khi nâng cấp
Một phép thử có ích nên dùng trace từ chính workload của team:
- Replay cùng task trên Fable 5 và Fable 5.1 với effort giống nhau.
- Ghi input, output, cache-read token, số lần gọi tool và số lần safeguards can thiệp.
- So sánh chi phí cho mỗi task đạt tiêu chí, không chỉ giá cho mỗi token.
- Kiểm tra integration có sửa prior context hay phụ thuộc vào transcript suy luận hay không.
- Với dữ liệu nhạy cảm, xác nhận hợp đồng retention và kiến trúc EFS thực tế thay vì suy luận từ tên tính năng.
Fable 5.1 đáng để benchmark lại khi agent của bạn đọc nhiều context đã cache. Bảng điểm rộng là tín hiệu để thử, còn quyết định đổi model nên dựa trên trace, failure rate và chi phí tái hiện được.