Tóm tắt
OpenAI đang dùng model để tấn công model của chính mình. GPT-Red là một automated red-teaming model nội bộ, được train để tìm prompt injection trong các môi trường thực tế như email, webpage, local file, tool output và code repository.
Mục tiêu không phải phát hành một attacker ra ngoài, mà là dùng attacker đó để tạo dữ liệu adversarial cho quá trình train model production. OpenAI nói GPT-5.6 Sol có số failure thấp hơn 6x trên benchmark direct prompt injection khó nhất của họ so với model production tốt nhất bốn tháng trước.
Phát hiện chính
- GPT-Red được train bằng self-play reinforcement learning: red-teamer được thưởng khi gây ra failure hợp lệ, defender models được thưởng khi chống được attack và vẫn hoàn thành task gốc.
- Trong một bản sao của indirect prompt injection arena từ Dziemian et al. (2025), GPT-Red tìm được attack thành công ở 84% scenario, trong khi human red teamers đạt 13%.
- GPT-Red từng tấn công một autonomous vending-machine agent và đạt cả ba mục tiêu độc hại: hạ giá item đắt xuống 0,50 USD, đặt item mới hơn 100 USD rồi bán 0,50 USD, và hủy đơn của khách khác.
- OpenAI cũng dùng GPT-Red để attack Codex CLI agent dựa trên GPT-5.4 mini trong 10 kịch bản data exfiltration; GPT-Red hiệu quả hơn và dùng token tiết kiệm hơn baseline GPT-5.5 được prompt.
- Một lớp attack “Fake Chain-of-Thought” từng có success rate trên 95% với GPT-5.1, nhưng giảm xuống dưới 10% với GPT-5.6 Sol.
- Trên tập robustness rộng hơn, GPT-5.6 Sol chỉ fail 0,05% trước direct prompt injection của GPT-Red.
Phương pháp
GPT-Red hoạt động giống một red teamer có vòng lặp: gửi prompt, quan sát phản hồi của target model, rồi chỉnh attack. Điểm khác biệt là vòng lặp này được scale bằng training, không phụ thuộc hoàn toàn vào bài test thủ công của con người.
OpenAI xây dựng nhiều environment có threat model rõ ràng: attacker kiểm soát phần nào của webpage, email, local file hoặc tool response; hệ thống tính success khi model bị dụ làm hành động sai mục tiêu. Defender models cũng được train trong cùng quá trình, nên khi defender tốt hơn thì GPT-Red buộc phải tìm attack mạnh hơn.
OpenAI giữ GPT-Red tách khỏi model production. Cách này tránh đưa năng lực tấn công đã train kỹ ra ngoài, nhưng vẫn chuyển được dữ liệu attack vào training để tăng robustness cho model được deploy.
Ý nghĩa với Dev
Nếu app của bạn cho LLM đọc dữ liệu từ bên thứ ba rồi gọi tool, prompt injection là bug hệ thống, không phải prompt engineering lặt vặt. Email, issue tracker, web page, file markdown và output từ MCP/tool đều có thể trở thành input độc hại.
Dev nên quan tâm vì mô hình phòng thủ đang dịch từ “thêm instruction đừng nghe lệnh xấu” sang eval + adversarial training + monitoring. Ngay cả khi bạn không có GPT-Red, bạn vẫn có thể copy tư duy: định nghĩa threat model, tạo scenario attack, đo success rate, rồi thêm test regression trước khi mở thêm tool permission.
Một checklist tối thiểu cho agent có tool access:
- Tách rõ trusted instruction, user input và untrusted external content.
- Log tool calls kèm nguồn dữ liệu đã ảnh hưởng đến quyết định.
- Viết eval cho data exfiltration, destructive action và confused deputy.
- Bắt approval cho hành động có chi phí, quyền riêng tư hoặc thay đổi trạng thái thật.
- Không coi refusal rate cao là robustness; agent vẫn phải làm được task hợp lệ.