Tin nổi bật
GPT-Red: OpenAI dùng model tấn công để vá prompt injection · 8 phút https://openai.com/index/unlocking-self-improvement-gpt-red
Nếu bạn đang build agents có quyền đọc email, file, browser hay tool output, đây là bài nên đọc kỹ chứ không phải lướt headline. GPT-Red là model red-team nội bộ được train bằng self-play reinforcement learning để tìm prompt injection, rồi dùng chính attack đó để adversarially train GPT-5.6. Con số đáng tiền: GPT-5.6 Sol giảm 6x failure trên benchmark direct prompt injection khó nhất so với production model tốt nhất bốn tháng trước, và chỉ fail 0,05% trước direct prompt injection của GPT-Red. Phần hơi lạnh gáy là GPT-Red đã phá được một agent bán hàng tự động và một Codex CLI agent trong kịch bản exfiltrate data, nên threat model này không còn là trò chơi prompt vui vui nữa. Bài học thực tế: agent security phải được train và test như một hệ thống có attacker chủ động, không chỉ thêm một đoạn system prompt kiểu “đừng làm bậy”.
Models & Tools
Cars24 vận hành voice/chat agents trên toàn phễu bán xe · 5 phút https://openai.com/index/cars24
Cars24 đang xử lý hơn một triệu phút hội thoại mỗi tháng bằng AI agents cho mua xe, bán xe, tài chính, follow-up và support. Case study này hay ở chỗ nó không bán mộng “AI thay hết nhân viên”, mà cho thấy agent sống được khi workflow đủ cụ thể: hỏi nhu cầu, đặt test drive, nhắc lịch, thu giấy tờ, rồi đẩy lead quay lại funnel.
Google Search AI Mode bắt đầu nối trực tiếp với app bên thứ ba · 2 phút https://blog.google/products-and-platforms/products/search/connected-apps/
Search đang biến thành một agent surface: người dùng có thể nối Instacart, Canva, YouTube Music rồi thao tác ngay trong AI Mode. Với dev làm product consumer, đây là tín hiệu rõ: integration point sắp không chỉ là app store hay browser extension, mà là nơi assistant gọi hành động thay người dùng.
Google Vids thêm Gemini Omni và personal avatars · 3 phút https://blog.google/products-and-platforms/products/workspace/gemini-omni-personal-avatars/
Gemini Omni cho phép generate video từ text + image reference và edit clip bằng chat, còn personal avatar tạo người dẫn từ selfie + voice recording. Nghe hơi corporate, nhưng workflow “prompt -> draft -> chat sửa lighting/background/effect” là thứ nhiều tool creative sẽ phải hỗ trợ nếu không muốn bị Workspace nuốt mất phần low-end.
Research & Insights
Đừng đo AI bằng giá token, hãy đo cost per successful task · 6 phút https://openai.com/index/a-scorecard-for-the-ai-age
OpenAI đề xuất metric “Useful Intelligence per Dollar”: công việc hoàn thành, chi phí cho task thành công, độ tin cậy, và giá trị khi scale. Với team engineering, cách dịch thẳng là: đừng khoe model rẻ hơn 30% nếu nó làm tăng retry, review và rework; hãy đo số PR qua test, số incident triage xong, hoặc số ticket support resolve được trên mỗi đô la.
— tinAI