Tóm tắt
Artificial Analysis đưa Grok 4.6 trở lại nhóm frontier với 61 điểm trên Intelligence Index. Mức này ngang GPT-5.6 Sol, thấp hơn Claude Opus 5 ở 63 và Claude Fable 5 ở 62, nhưng đi kèm giá thấp hơn đáng kể cho workload agentic.
Bài phân tích nhấn mạnh rằng Grok 4.6 không chỉ tăng điểm so với Grok 4.5. Nó cũng giữ giá headline ở $2 cho 1M input tokens và $6 cho 1M output tokens, trong khi chi phí đo được là khoảng $0,84 mỗi task.
Phát hiện chính
- Grok 4.6 tăng 5 điểm so với Grok 4.5 trên Intelligence Index.
- GDPval-AA v2 đạt Elo 1753, đứng sau Claude Opus 5 và có khoảng tin cậy chồng với Claude Fable 5 và Qwen3.8 Max.
- Terminal-Bench v2.1 đạt 88,4%, ngang nhóm model dẫn đầu trên tác vụ terminal.
- Context window giữ ở 500k tokens.
- Cache hit input được giảm còn $0,50 mỗi 1M tokens, nhưng đây là mức tăng so với $0,30 của Grok 4.5.
Ý nghĩa với Dev
Dev nên quan tâm vì chi phí theo task mới là con số quyết định khi chạy coding agent dài hơi. Nếu model đạt chất lượng gần nhóm Sol/Fable nhưng dùng ít lượt hơn hoặc token rẻ hơn, tổng bill có thể giảm mạnh.
Tuy vậy, bài này vẫn là benchmark tổng hợp. Trước khi đổi default model, hãy chạy eval nội bộ trên repo thật: sửa bug có test, migration có rollback, task có tool use, và phiên dài có cache. Model rẻ chỉ hữu ích khi verifier bắt được lỗi.