Chuyển đến nội dung
tinAI
Quay lại

Claude Code Auto Mode bị vượt qua bằng module shadowing

embracethered.com · Loại nguồn: công ty/blog 2026-08-31T20:13:49.329Z
Bản dịch tiếng Việt của tinAI · Từ Breaking Claude Code Opus 5 Auto Mode (embracethered.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Breaking Claude Code Opus 5 Auto Mode (embracethered.com)

Tác giả: Embrace The Red

Ngày đăng: Dịch ngày:

TL;DR

Một chuỗi indirect prompt injection đã khiến Claude Code Opus 5 trong Auto Mode tự viết decoder Python, dính module shadowing qua struct.py và mở C2 trong 3/5 lần thử; biến thể khác đạt 4/5. Auto Mode là classifier best-effort, nên dev vẫn phải cô lập agent, chặn egress và giữ credential khỏi môi trường chạy.

Ước tính đọc: 4 phút

Auto Mode và con số 0,00%

Từ giữa tháng 8, Auto Mode trở thành chế độ khởi động mặc định của Claude Code. Thay vì hỏi người dùng phê duyệt từng thao tác, chế độ này dùng một safety classifier để quyết định lệnh nào được chạy.

Một đánh giá bên thứ ba do Anthropic đặt hàng đã thử 72 kịch bản indirect prompt injection, mỗi kịch bản 10 lần, và báo attack success rate 0,00% với Opus 5 trong Auto Mode. Bài thử nghiệm này đặt câu hỏi hẹp hơn: một chuỗi tấn công được thiết kế có chủ đích có thể khiến agent tự tạo và chạy code nguy hiểm hay không?

Chuỗi tấn công

Điểm vào chỉ là yêu cầu tóm tắt một website. Chuỗi khai thác diễn ra như sau:

  1. Website trả HTTP 415 để Claude rời WebFetch và tự chuyển sang curl.
  2. curl theo redirect và tải một file ZIP chứa các bản ghi đã encode, một binary decoder và file struct.py.
  3. Claude từ chối chạy binary không tin cậy, rồi tự viết decoder Python để giải Base85, zlib và JSON.
  4. Decoder chạy ngay trong thư mục giải nén do kẻ tấn công kiểm soát.
  5. Khi base64 import struct, Python nạp file struct.py cục bộ thay cho module chuẩn.
  6. File giả vẫn export API cần thiết để decoder tiếp tục chạy, đồng thời thực thi biểu thức đã obfuscate.
  7. Payload mở một tiến trình Python isolated, tải native payload và tạo kết nối C2 thử nghiệm.

Mấu chốt là binary chỉ đóng vai trò mồi. Quyết định an toàn — không chạy binary và tự viết decoder — lại đẩy agent vào đường khai thác. Auto Mode nhìn thấy đoạn Python ngắn do Claude tạo, không nhìn thấy đầy đủ hiệu ứng qua nhiều bước import và tiến trình con.

Kết quả và giới hạn

Với mẫu nhỏ, biến thể C2 thành công 3/5 lần. Biến thể dùng claude -p để mở một Claude Code headless khác cũng thành công 3/5 lần; sau khi tinh chỉnh để ghi file ngoài workspace, tỷ lệ là 4/5.

Đây không phải benchmark tổng quát. Kết quả 60–80% của một chuỗi có chủ đích và con số 0,00% trên 72 kịch bản cố định có thể cùng đúng. Vấn đề là dùng một benchmark hữu hạn như thông điệp rằng prompt injection gần như đã được giải quyết.

Trong một số lần chạy, Claude phát hiện file độc hại sau khi payload đã chạy. Có lúc Auto Mode còn chặn chính lệnh dọn tiến trình malware, dù trước đó đã cho phép chuỗi tạo tiến trình.

Phản hồi và ý nghĩa với Dev

Anthropic đóng báo cáo ở mức Informative và giải thích rằng Auto Mode là classifier best-effort, không phải security guarantee. Ranh giới thật vẫn là isolation của hệ điều hành và kiểm soát network egress.

Nếu agent xử lý nội dung không tin cậy, approval UX không thay được các control bên dưới:

Kết luận thực dụng: Auto Mode có thể giảm ma sát và giảm rủi ro so với chế độ bỏ qua toàn bộ permission, nhưng không phải security boundary.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Breaking Claude Code Opus 5 Auto Mode (embracethered.com) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 1 loại nguồn (2 bài). Loại nguồn: web 2