Chuyển đến nội dung
tinAI
Quay lại

GPT-Red: dùng model tấn công để tăng độ bền trước prompt injection

openai.com · Loại nguồn: công ty/blog 2026-07-17T23:04:51.944Z
Bản dịch tiếng Việt của tinAI · Từ GPT-Red: Unlocking Self-Improvement for Robustness (openai.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: GPT-Red: Unlocking Self-Improvement for Robustness (openai.com)

Tác giả: OpenAI

Ngày đăng: Dịch ngày:

TL;DR

OpenAI giới thiệu GPT-Red, một model red-team nội bộ được train để tạo prompt injection và các kịch bản tấn công agent. GPT-Red được dùng trong adversarial training cho GPT-5.6, giúp GPT-5.6 Sol giảm mạnh failure trên các benchmark prompt injection mà vẫn giữ năng lực tổng quát.

Ước tính đọc: 5 phút

Tóm tắt

Prompt injection đang trở thành bài toán bảo mật cốt lõi của AI agents. Khi model đọc email, webpage, local file, code repository hoặc tool output, attacker có thể nhúng instruction độc hại vào dữ liệu mà model xem là ngữ cảnh. Human red-team vẫn cần thiết, nhưng không đủ scale để tạo lượng dữ liệu tấn công đa dạng cho quá trình training.

GPT-Red là nỗ lực của OpenAI để scale red-teaming bằng chính model. Thay vì chỉ đánh giá sau khi model đã train xong, GPT-Red tạo attack trong quá trình huấn luyện để giúp production model học cách chống lại các instruction độc hại.

Vấn đề

Các hệ thống AI hiện đại thường làm việc qua browser, connected apps, local files và nhiều tool khác. Những quyền này làm agent hữu ích hơn, nhưng cũng tạo bề mặt tấn công rộng hơn: email có thể chứa instruction lừa agent gửi dữ liệu ra ngoài, webpage có thể yêu cầu agent bỏ qua policy, hoặc tool response có thể nhúng lệnh giả.

OpenAI nói các robustness evaluation phổ biến đã bị những model mới nhất vượt qua, nên cần phương pháp khó hơn. Nếu benchmark quá dễ, team sẽ có cảm giác model đã an toàn trong khi attacker thực tế vẫn còn nhiều đường đi.

GPT-Red được train thế nào

GPT-Red được train bằng self-play reinforcement learning. Một phía là red-team model, phía còn lại là nhiều defender LLM khác nhau. GPT-Red được thưởng khi tạo được failure hợp lệ, ví dụ prompt injection thành công; defender được thưởng khi hoàn thành task gốc mà không nghe theo instruction độc hại.

Các environment mô phỏng nhiều vị trí attacker có thể kiểm soát: một phần của local file, banner trên webpage, nội dung email, hoặc output của tool. Khi defender mạnh lên, GPT-Red phải tìm attack tinh vi hơn để tiếp tục thắng.

OpenAI giữ GPT-Red tách khỏi model public. Lý do khá rõ: GPT-Red được train để có năng lực tấn công, nên không nên phát hành trực tiếp capability đó ra ngoài.

Kết quả chính

GPT-Red được đưa vào training process của production models. Với GPT-5.6 Sol, OpenAI báo cáo model có số failure thấp hơn 6 lần trên benchmark direct prompt injection khó nhất so với production model tốt nhất bốn tháng trước.

Trong một mirror nội bộ của indirect prompt injection arena từ Dziemian et al. (2025), GPT-Red tìm được attack thành công trên 84% scenario, trong khi human red-teamers đạt 13%. OpenAI cũng cho biết các attack “Fake Chain-of-Thought” từng có success rate trên 95% với GPT-5.1, nhưng hiện xuống dưới 10% với GPT-5.6 Sol.

Trên tập robustness rộng hơn, GPT-5.6 Sol chỉ fail 0,05% trước direct prompt injection của GPT-Red. Điểm quan trọng là OpenAI nói năng lực tổng quát không giảm; robustness tăng không đến từ việc model từ chối nhiều hơn hoặc trở nên kém hữu dụng hơn.

Case study thực tế

OpenAI thử GPT-Red với một vending-machine agent trong văn phòng, tương tự Project Vend của Andon Labs. GPT-Red được mô tả hệ thống, thử attack trong simulation, quan sát tool calls, rồi chuyển attack sang production agent. Kết quả: agent bị khiến đổi giá một món hàng đắt xuống mức tối thiểu 0,50 USD, sửa hướng dẫn hệ thống cho các ca sau, và hủy đơn của khách khác.

OpenAI cũng dùng GPT-Red để tấn công Codex CLI agent dựa trên GPT-5.4 mini trong 10 kịch bản data exfiltration held-out. GPT-Red hiệu quả hơn baseline GPT-5.5 được prompt thủ công, đồng thời dùng ít token hơn.

Ý nghĩa với Dev

Dev nên quan tâm vì đây là threat model của mọi agent có tool access, không chỉ của frontier lab. Nếu agent có thể đọc dữ liệu bên thứ ba rồi gọi API, gửi email, sửa file hoặc chạy command, thì dữ liệu đầu vào chính là attack surface.

Một vài thực hành rút ra được:

Kết luận

GPT-Red không phải một product để dev tải về dùng. Giá trị của bài này nằm ở mô hình vận hành: dùng attacker tự động để tìm failure mode, đưa failure đó vào training hoặc test suite, rồi đo lại bằng scenario thực tế.

Với agent systems, câu hỏi không còn là “model có ngoan không”. Câu hỏi đúng hơn là: khi một nguồn dữ liệu không đáng tin cố tình ra lệnh cho agent, hệ thống của bạn có biết đó là dữ liệu hay lại xử lý như instruction?


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ GPT-Red: Unlocking Self-Improvement for Robustness (openai.com) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: công ty/blog 1 Loại nguồn: web 1