Tin nổi bật
Claude Opus 5: model agentic coding mới của Anthropic · 8 phút https://www.anthropic.com/news/claude-opus-5
Nếu bạn đang build agents, đây là tin quan trọng nhất hôm nay. Opus 5 nhắm thẳng vào việc code dài hơi: Anthropic nói model hơn gấp đôi Opus 4.8 trên Frontier-Bench v0.1, gần Fable 5 trên CursorBench 3.2 nhưng chi phí mỗi task chỉ bằng khoảng một nửa Fable. Phần đáng thử ngay không chỉ là benchmark, mà là API: claude-opus-5, giá $5/triệu input token và $25/triệu output token, có Fast mode nhanh khoảng 2.5 lần, thêm mid-conversation tool changes để đổi tool mà không phá prompt cache. Tôi vẫn muốn xem eval độc lập trên repo thật, nhưng nếu workload của bạn là debugging nhiều file, agent tự kiểm tra, hoặc workflow automation có tool use, đây là bản Claude nên đưa vào benchmark nội bộ trong tuần này.
Models & Tools
PyTorch Monarch đã chạy trên AMD ROCm · 7 phút https://pytorch.org/blog/bringing-pytorch-monarch-to-amd-gpus-single-controller-distributed-training-on-rocm/
Training lớn hay chết ở chỗ cluster hỏng giữa chừng, không phải ở slide benchmark đẹp. Monarch trên ROCm đưa mô hình single-controller, actor runtime, RDMA/RCCL và supervision tree sang AMD GPU; bài viết còn nói toàn bộ 1.171 test pass sau lớp compatibility cho HIP. Team nào đang cân nhắc MI325/ROCm cho distributed training nên đọc kỹ phần fault recovery, vì checkpoint kiểu truyền thống sẽ rất đau khi job chạy nhiều ngày.
Open-weight AI đang có khoảnh khắc Kubernetes · 6 phút https://tobi.knaup.me/2026-07-25-open-weight-ai-is-having-its-kubernetes-moment/
Lập luận hay nhất của bài này: open weights biến model thành platform, giống cách Kubernetes biến container orchestration thành nền chung cho cả ecosystem. Ví dụ cụ thể là vLLM, SGLang, llama.cpp, Ollama, MLX, LoRA, quantization và hơn 2 triệu public models trên Hugging Face. Tôi không mua trọn phép so sánh vì model weights không phải source code, nhưng xu hướng dev tự host, fine-tune và tối ưu inference đang đủ mạnh để các team product phải có chiến lược ngoài một API vendor duy nhất.
Một system prompt để AI bớt giả làm người · 3 phút https://swiftrocks.com/a-system-prompt-to-get-ai-to-stop-pretending-to-be-human
Có khi cải thiện UX của AI agent chỉ là cấm nó nói kiểu “great question” rồi vòng vo như support chatbot. Prompt trong bài ép model dùng giọng kỹ thuật trung tính, bỏ filler, bỏ mấy câu xã giao giả, và trả lời giống CLI hơn. Không cần thần thánh hóa prompt này; coi nó là baseline tốt cho coding assistant nội bộ khi bạn muốn log ngắn, rõ, dễ audit.
Research & Insights
Kimi K3 tiến gần frontier về cyber, nhưng chưa ngang nhóm dẫn đầu · 5 phút https://www.nist.gov/news-events/news/2026/07/uk-aisi-caisi-preliminary-assessment-kimi-k3s-cyber-capabilities
Báo cáo UK AISI/CAISI cho thấy Kimi K3 đạt 32% trên ExploitBench, cao hơn GLM-5.2 ở mức 24%, nhưng vẫn không đạt arbitrary code execution trên 41 mẫu; nhóm model cyber mạnh nhất đạt trung bình 20/41. Trong cyber range TLO, Kimi K3 đi tới bước 17/32 và hoàn thành 1/10 lần, còn nhóm US dẫn đầu đạt trung bình 28.5 bước. So what cho dev: open-weight model đang đủ mạnh để security review và abuse review phải đi cùng nhau, nhất là khi bạn cho agent quyền chạy shell, đọc repo, hoặc thử exploit trong lab.
Ảo giác năng suất AI: nhanh hơn chưa chắc rẻ hơn · 7 phút https://www.hardresetmedia.com/p/the-ai-productivity-illusion
Bài này dội gáo nước lạnh khá cần thiết: productivity kinh tế không chỉ là tạo nhiều text hoặc nhiều code hơn trong ít giờ hơn. Nếu output sai, cần review nhiều, hoặc tạo thêm “workslop” khiến người khác mất thời gian dọn, ROI có thể âm dù cá nhân cảm thấy mình chạy nhanh. Với team dev, câu hỏi đúng không phải “AI viết được bao nhiêu dòng”, mà là bug rate, thời gian review, incident risk, và giá trị thật sau khi ship.
— tinAI