Tin nổi bật
Claude 5: bớt luật, thiết kế context thông minh hơn · 5 phút https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
Anthropic nói họ đã xoá hơn 80% system prompt của Claude Code cho Opus 5/Fable 5 mà không mất điểm trên eval coding. Tín hiệu hay ở đây không phải là “prompt ngắn hơn là thắng”, mà là agent harness cần ít khẩu hiệu và nhiều interface rõ: tool schema tốt, Skill tách nhỏ, CLAUDE.md chỉ giữ gotcha thật sự của repo. Nếu bạn đang nhồi cả handbook vào system prompt, bài này là lời nhắc khá đau: context dài đôi khi chỉ bắt model tiêu token để gỡ mâu thuẫn do chính mình tạo ra. Việc nên làm trong tuần này là audit lại instruction stack, xoá rule trùng nhau, và chuyển quy trình verify/code review sang skill hoặc file nạp khi cần.
Models & Tools
Open-weight AI đang thành nền móng kiểu Kubernetes · 7 phút https://tobi.knaup.me/2026-07-25-open-weight-ai-is-having-its-kubernetes-moment/
Tobi Knaup dùng bài học Mesos/Kubernetes để nói về open-weight models: khi base đủ tốt và portable, ecosystem xung quanh nó tăng tốc nhanh hơn một vendor đóng. Bài viết dẫn Hugging Face với hơn 2 triệu public models, GLM-5.2 MIT license, Kimi K3 sắp public weights ngày 27/7, rồi đặt câu hỏi khá thực dụng: dev nên build quanh một API đóng hay quanh stack có thể self-host, fine-tune, quantize và quan sát được?
LLM 28,9M tham số chạy trên ESP32-S3 giá 8 USD · 4 phút https://github.com/slvDev/esp32-ai
Không, con chip này chưa giúp bạn viết code ở rìa mạng. Phần hay nằm ở layout bộ nhớ: 25M tham số ở flash, core nhỏ ở SRAM/PSRAM, mỗi token chỉ đọc khoảng 450 byte và vẫn đạt khoảng 9,5 tok/s. Với TinyStories thì output còn rất hẹp, nhưng trick Per-Layer Embeddings trên microcontroller là một hướng đáng thử cho thiết bị offline siêu rẻ.
Cloudflare tách bot AI thành Search, Agent và Training · 6 phút https://blog.cloudflare.com/content-independence-day-ai-options/
Cloudflare không còn coi “AI bot” là một cục nữa: dashboard mới cho phép quản lý riêng Search, Agent và Training, kể cả Free tier. Từ 15/9/2026, domain mới có ads sẽ mặc định block Training và Agent trên các trang đó, còn Search vẫn được cho qua; multi-purpose crawler bị áp luật chặt nhất. Nếu bạn vận hành content site hoặc docs public, đây là lúc xem lại robots.txt, Content Signals và policy cho agent traffic thay vì chỉ block tất cả.
Research & Insights
PyTorch Monarch lên ROCm cho training chịu lỗi · 6 phút https://pytorch.org/blog/bringing-pytorch-monarch-to-amd-gpus-single-controller-distributed-training-on-rocm/
Ở scale 128-256 GPU, lỗi node không còn là tai nạn hiếm mà là chuyện vận hành bình thường. Monarch trên ROCm tách orchestration, supervision tree và TorchFT quorum để replica khoẻ tiếp tục train khi replica lỗi restart cục bộ, rồi sync lại qua peer checkpoint. Phần thực tế nhất: port HIP/RCCL/RDMA đã qua 1.171 test và chạy trên MI300/MI355, nghĩa là AMD stack đang có thêm mảnh ghép nghiêm túc cho pretraining lớn.
Debian tranh luận bốn hướng về đóng góp có LLM hỗ trợ · 5 phút https://www.debian.org/vote/2026/vote_002
Đây không phải paper, nhưng là case study rất thật cho mọi team maintain OSS: cấm hẳn, cho phép có disclosure, khuyến nghị tránh dùng, hay chấp nhận với trách nhiệm rõ. Debian đang đưa copyright, accountability, review load và quyền riêng tư vào cùng một cuộc bỏ phiếu, thay vì chỉ hỏi “AI tốt hay xấu”. Nếu repo của bạn bắt đầu nhận PR do agent tạo, đọc bốn proposal này rồi viết policy trước khi reviewer bị biến thành bộ lọc rác.
— tinAI