Tin nổi bật
GPT-Red: OpenAI dùng model để tự red-team prompt injection · 8 phút https://openai.com/index/unlocking-self-improvement-gpt-red
Nếu bạn đang build agents, đây là tin quan trọng nhất tuần. GPT-Red là model nội bộ được train bằng self-play reinforcement learning để săn prompt injection trong email, webpage, file local, tool output và cả repo code. Con số làm tôi tỉnh ngủ: trên một arena indirect prompt injection, GPT-Red tìm được attack thành công ở 84% scenario, trong khi human red teamers chỉ đạt 13%; GPT-5.6 Sol sau adversarial training thì giảm 6x failure trên benchmark khó nhất của OpenAI. Phần thực dụng nằm ở chỗ họ test cả Codex CLI agent với kịch bản data exfiltration, nghĩa là threat model này không còn là chuyện chatbot trả lời sai, mà là agent có tool access bị dụ làm việc bậy.
Models & Tools
Google Search AI Mode kết nối trực tiếp Instacart, Canva, YouTube Music · 3 phút https://blog.google/products-and-platforms/products/search/connected-apps/
Trước đây Search trả lời rồi bạn tự nhảy sang app khác để làm tiếp; giờ AI Mode bắt đầu nối thẳng sang dịch vụ bên thứ ba. Đợt rollout tại Mỹ cho phép thêm nguyên liệu vào giỏ Instacart, gọi template Canva, hoặc tạo playlist YouTube Music ngay trong luồng tìm kiếm. Hay thì hay, nhưng dev nên soi kỹ lớp permission và audit trail, vì đây chính là kiểu surface nơi prompt injection và confused deputy dễ thành bug thật.
Google Vids thêm Gemini Omni và avatar cá nhân · 3 phút https://blog.google/products-and-platforms/products/workspace/gemini-omni-personal-avatars/
Video nội bộ đang bị kéo về cùng một workflow như code review: tạo draft bằng prompt, chỉnh tiếp từng bước, rồi ship. Gemini Omni trong Google Vids nhận text prompt kèm image reference để generate hoặc edit clip; personal avatars dùng selfie và voice recording để đọc script thay bạn. Catch: tính năng nằm sau Google AI Pro/Ultra hoặc Workspace business, và avatar còn bị giới hạn theo khu vực, nên đây chưa phải primitive mở cho mọi toolchain.
Cars24 chạy hơn 1 triệu phút hội thoại AI mỗi tháng · 5 phút https://openai.com/index/cars24
Con số nên copy không phải “AI agent” mà là cách họ gắn agent vào funnel cụ thể: hỏi nhu cầu mua xe, book test drive, follow-up tài chính, nhắc lịch, rồi kéo lead cũ quay lại. Cars24 cũng đưa Codex vào Linear và GitHub để PM tạo ticket, engineer xử lý bug, team nhận update tự động; 600 nhân viên trung tâm dùng ChatGPT Enterprise/Codex với 85-90% daily active usage. Vì đây là case study từ vendor, tôi đọc nó như blueprint triển khai hơn là bằng chứng độc lập.
Research & Insights
Đo agent bằng cost per accepted outcome, không phải token rẻ · 5 phút https://openai.com/index/managing-ai-investments-in-agentic-era
Token rẻ là metric lười. Bài của OpenAI đưa ra khung “useful work per dollar”: task hoàn tất, thời gian tiết kiệm, quyết định tốt hơn, workflow đủ ổn để scale. Chi tiết đáng đem về backlog là đo cost per accepted outcome: với coding agent, đó có thể là một change đã test và qua review, kèm attempts, latency, tool usage và human review, chứ không phải tổng token nhìn cho có dashboard.
— tinAI