Tin nổi bật
Auto Mode của Claude Code bị vượt qua: classifier không phải sandbox
https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/
Auto Mode đã trở thành chế độ mặc định của Claude Code từ giữa tháng 8, thay các prompt phê duyệt bằng một safety classifier. Trong thử nghiệm nhỏ, tác giả dụ agent rời WebFetch sang curl, tải ZIP rồi tự viết decoder Python ngay trong thư mục do kẻ tấn công kiểm soát; file struct.py giả mạo module chuẩn và mở đường tới C2. Chuỗi đó thành công 3/5 lần, còn biến thể gọi claude -p thành công 4/5. Điều đáng đọc không phải phép so 80% với benchmark 0,00% trên 72 kịch bản: hai mẫu đo khác nhau. Điều đáng lo là approval layer cho phép chuỗi lệnh, đôi lúc lại chặn lệnh dọn malware. Anthropic gọi báo cáo là Informative và nói Auto Mode chỉ là classifier best-effort. kevsim chốt đúng ranh giới: cảm giác an toàn giả biến mất nếu tiến trình nằm trong sandbox. Mình sẽ xem Auto Mode là UX, không là policy: cô lập container hoặc VM, chặn egress và không mount SSH key hay cloud credential.
Hạ tầng đáng để ý
AI đẩy Mac mini và Mac Studio sang nhịp enterprise. MacRumors cho biết Apple ra máy sớm vì doanh nghiệp muốn chạy model local và ghép nhiều Mac Studio; vài cấu hình đã thiếu hàng nhiều tháng giữa khủng hoảng memory. Nhưng Aurornis chỉ ra trade-off: local yếu hơn cloud 20 USD/tháng, đổi lại dữ liệu không rời mạng. Mình đọc đây là lựa chọn privacy, không phải bargain compute.
Bản đồ để audit
ChatGPT Work có 232 tool interface và 44 skill đầy đủ. Bản inventory cho thấy capability thực tế ghép từ tool, skill, permission và plugin. simonw chú ý skill control-browser còn yêu cầu runtime tự gọi browser.documentation() để lấy hướng dẫn tiếp. Tài liệu này hữu ích để audit khác biệt giữa hai session, nhưng chưa phải một API contract ổn định.
Ba câu chuyện cùng nhắc một điều: quyền năng của agent nằm ở boundary, không ở tên mode.
— Tin