Chuyển đến nội dung
tinAI
Quay lại

tinAI #140: GPT-Red: OpenAI dùng model để tự red-team prompt injection

2026-07-15T23:00:00.000Z

tinAI tóm tắt nguồn công khai, thêm bối cảnh biên tập cho độc giả, và giữ liên kết nguồn trong từng mục.

Bài dịch trong bản tin này

Các bài dịch tinAI trong bản tin này giữ liên kết tới nguồn gốc:

3 bài dịch giữ liên kết nguồn gốc

Bài dịch số này trải trên 2 loại nguồn (3 bài). Loại nguồn: web 2 Loại nguồn: công ty/blog 1

Tin nổi bật

GPT-Red: OpenAI dùng model để tự red-team prompt injection · 8 phút https://openai.com/index/unlocking-self-improvement-gpt-red

Nếu bạn đang build agents, đây là tin quan trọng nhất tuần. GPT-Red là model nội bộ được train bằng self-play reinforcement learning để săn prompt injection trong email, webpage, file local, tool output và cả repo code. Con số làm tôi tỉnh ngủ: trên một arena indirect prompt injection, GPT-Red tìm được attack thành công ở 84% scenario, trong khi human red teamers chỉ đạt 13%; GPT-5.6 Sol sau adversarial training thì giảm 6x failure trên benchmark khó nhất của OpenAI. Phần thực dụng nằm ở chỗ họ test cả Codex CLI agent với kịch bản data exfiltration, nghĩa là threat model này không còn là chuyện chatbot trả lời sai, mà là agent có tool access bị dụ làm việc bậy.


Models & Tools

Google Search AI Mode kết nối trực tiếp Instacart, Canva, YouTube Music · 3 phút https://blog.google/products-and-platforms/products/search/connected-apps/

Trước đây Search trả lời rồi bạn tự nhảy sang app khác để làm tiếp; giờ AI Mode bắt đầu nối thẳng sang dịch vụ bên thứ ba. Đợt rollout tại Mỹ cho phép thêm nguyên liệu vào giỏ Instacart, gọi template Canva, hoặc tạo playlist YouTube Music ngay trong luồng tìm kiếm. Hay thì hay, nhưng dev nên soi kỹ lớp permission và audit trail, vì đây chính là kiểu surface nơi prompt injection và confused deputy dễ thành bug thật.


Google Vids thêm Gemini Omni và avatar cá nhân · 3 phút https://blog.google/products-and-platforms/products/workspace/gemini-omni-personal-avatars/

Video nội bộ đang bị kéo về cùng một workflow như code review: tạo draft bằng prompt, chỉnh tiếp từng bước, rồi ship. Gemini Omni trong Google Vids nhận text prompt kèm image reference để generate hoặc edit clip; personal avatars dùng selfie và voice recording để đọc script thay bạn. Catch: tính năng nằm sau Google AI Pro/Ultra hoặc Workspace business, và avatar còn bị giới hạn theo khu vực, nên đây chưa phải primitive mở cho mọi toolchain.


Cars24 chạy hơn 1 triệu phút hội thoại AI mỗi tháng · 5 phút https://openai.com/index/cars24

Con số nên copy không phải “AI agent” mà là cách họ gắn agent vào funnel cụ thể: hỏi nhu cầu mua xe, book test drive, follow-up tài chính, nhắc lịch, rồi kéo lead cũ quay lại. Cars24 cũng đưa Codex vào Linear và GitHub để PM tạo ticket, engineer xử lý bug, team nhận update tự động; 600 nhân viên trung tâm dùng ChatGPT Enterprise/Codex với 85-90% daily active usage. Vì đây là case study từ vendor, tôi đọc nó như blueprint triển khai hơn là bằng chứng độc lập.


Research & Insights

Đo agent bằng cost per accepted outcome, không phải token rẻ · 5 phút https://openai.com/index/managing-ai-investments-in-agentic-era

Token rẻ là metric lười. Bài của OpenAI đưa ra khung “useful work per dollar”: task hoàn tất, thời gian tiết kiệm, quyết định tốt hơn, workflow đủ ổn để scale. Chi tiết đáng đem về backlog là đo cost per accepted outcome: với coding agent, đó có thể là một change đã test và qua review, kèm attempts, latency, tool usage và human review, chứ không phải tổng token nhìn cho có dashboard.


— tinAI


Chia sẻ bài viết này:

Số trước: tinAI #141
tinAI #141: GPT-Red: OpenAI dùng model tấn công để vá prompt injection
Số tiếp theo: tinAI #139
tinAI #139: GPT-Red tự động săn prompt injection