Chuyển đến nội dung
tinAI
Quay lại

AI worm qua tài liệu Word: khi prompt injection biết tự lan

enklypesalt.com · Loại nguồn: web 2026-07-29T20:07:41.758Z
Bản dịch tiếng Việt của tinAI · Từ Context Collapse, Part 3 - AI Worming through Word (enklypesalt.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Context Collapse, Part 3 - AI Worming through Word (enklypesalt.com)

Tác giả: Unknown

Ngày đăng: Dịch ngày:

TL;DR

Một disclosure phối hợp với Microsoft mô tả cách instruction ẩn trong tài liệu Word có thể khiến Copilot sửa nội dung và chép payload vào tài liệu mới. Microsoft đã vá một số payload cụ thể, nhưng tác giả nói class lỗi vẫn tái hiện được sau 144 ngày phối hợp.

Ước tính đọc: 3 phút

Tóm tắt

Bài viết mô tả một class prompt injection trong Copilot for Word: attacker giấu instruction trong tài liệu, Copilot đọc tài liệu đó như context, rồi xử lý instruction như một phần yêu cầu của người dùng. Trong PoC, Copilot có thể thay đổi số liệu trong báo cáo tài chính và chép instruction ẩn vào tài liệu mới.

Điểm khiến bài này khác các demo prompt injection thường gặp là khả năng tự lan qua workflow bình thường. Tài liệu mới được tạo bởi người dùng nội bộ, trông đáng tin hơn tài liệu gốc, nhưng lại mang payload ẩn để kích hoạt lần tiếp theo khi được dùng làm source material.

Chuỗi tấn công

Kịch bản bắt đầu bằng một tài liệu bên ngoài, ví dụ market analysis, có đoạn instruction được giấu bằng chữ trắng trên nền trắng hoặc font nhỏ. Người dùng đưa tài liệu này vào Copilot for Word, hoặc Copilot tự tìm thấy nó trong OneDrive khi soạn báo cáo. Vì Copilot phải đọc nội dung tài liệu để biết phần nào liên quan, instruction ẩn đi vào context của LLM.

Trong PoC, instruction yêu cầu Copilot sửa số liệu tài chính rồi chép lại chính payload vào cuối tài liệu mới bằng định dạng khó nhìn thấy. Khi tài liệu mới được dùng cho báo cáo tiếp theo, payload lại chạy dù tài liệu độc hại ban đầu không còn được attach.

Trạng thái disclosure

Tác giả nói báo cáo được gửi cho MSRC vào ngày 2026-03-06, sau đó disclosure kéo dài 144 ngày. Microsoft triển khai nhiều mitigation, bao gồm thay đổi trải nghiệm Edit with Copilot và nâng model. Dù vậy, bài viết cho biết attack chain vẫn tái hiện được với GPT-5.6 vào ngày 2026-07-15 và còn tái hiện vào ngày 2026-07-28.

Tác giả không công bố payload đầy đủ, nhưng mô tả class lỗi ở mức đủ để defender hiểu rủi ro. Khuyến nghị tạm thời là coi tài liệu ngoài là untrusted khi dùng với Copilot, review tài liệu trước khi đưa vào context, và review kỹ output trước khi chia sẻ hoặc tái sử dụng.

Ý nghĩa với Dev

Vấn đề gốc là ranh giới giữa instruction và data trong hệ thống LLM. Một tài liệu cần được đọc để phục vụ task, nhưng chính việc đọc đó cho attacker cơ hội ảnh hưởng đến quá trình suy luận. Dùng một LLM khác để lọc trước có thể giảm một số payload, nhưng vẫn đẩy cùng bài toán ra ngoài thêm một lớp.

Nếu bạn đang build agent đọc file, email, ticket, wiki hoặc trang web, hãy thiết kế hệ thống với giả định rằng content ngoài có thể chứa instruction độc hại. Cần lưu provenance của source, tách quyền ghi khỏi quyền đọc khi có thể, giữ log chỉnh sửa do model thực hiện, và buộc review ở các bước tạo tài liệu có tác động kinh doanh.

Điều cần giữ lại

Prompt injection không còn chỉ là chuyện model trả lời sai trong chat. Khi AI được quyền tạo tài liệu mới, gọi tool, tìm file và đưa output trở lại workflow, lỗi integrity có thể sống lâu hơn phiên chat ban đầu. Đây là bài toán product architecture, không phải một regex lọc prompt.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Context Collapse, Part 3 - AI Worming through Word (enklypesalt.com) · Loại nguồn: web và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: web 1