Chuyển đến nội dung
tinAI
Quay lại

OpenAI chậm frontier RL vì Astra có thể chạm ngưỡng cyber-critical

openai.com · Loại nguồn: công ty/blog 2026-08-18T20:08:57.482Z
Bản dịch tiếng Việt của tinAI · Từ Pacing model development in an era of cyber-critical capabilities (openai.com) · Ngày gốc: · Dịch ngày:

và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bài gốc: Pacing model development in an era of cyber-critical capabilities (openai.com)

Tác giả: OpenAI

Ngày đăng: Dịch ngày:

TL;DR

OpenAI nói họ tạm làm chậm một phần frontier training vì sự cố OpenAI-Hugging Face và tín hiệu Astra có thể đạt ngưỡng năng lực cyber-critical. Bài viết nêu các safeguard mới như sandbox mạnh hơn, monitoring từng sampled token, alert 30 phút và overhead khoảng 20% inference compute.

Ước tính đọc: 3 phút

Tóm tắt

OpenAI nói họ đã tạm làm chậm một phần quá trình phát triển frontier model sau hai tín hiệu mới: sự cố OpenAI-Hugging Face và bằng chứng sơ bộ rằng model Astra sắp tới có thể đạt ngưỡng Critical cybersecurity capability trong Preparedness Framework.

Thay đổi thực tế là một số workload training và inference có tool access phải đi qua chuẩn bảo mật cao hơn. OpenAI cũng mở rộng monitoring, alignment và isolation cho các run có khả năng tạo rủi ro cyber.

Có gì mới

OpenAI cho biết họ đã tạm dừng hai tuần các reinforcement learning run mới nhất dự định phục vụ deployment. Frontier RL run lớn nhất vẫn đang được giữ lại trong lúc họ chạy training nhỏ hơn, đánh giá hành vi model và kiểm tra safeguard.

Sau sự cố OpenAI-Hugging Face, OpenAI cũng tạm dừng frontier model inference trong research cluster đối với các run có thể execute code hoặc dùng tool truy cập internet. Một số workload đã chạy lại qua đường an toàn hơn; số khác cần migration thêm.

Safeguard kỹ thuật

OpenAI mô tả ba nhóm kiểm soát:

Điểm kỹ thuật đáng chú ý là monitoring setup nhiều tầng. Activation classifier kiểm tra từng sampled token, rồi đẩy tín hiệu đáng ngại sang investigator tự động có compute cao hơn. Hệ thống xem tool actions, reasoning có sẵn và chuỗi hoạt động để phát hiện truy cập trái phép, đánh cắp dữ liệu, phá hoại hoặc né safeguard.

Ngưỡng vận hành mới

OpenAI nói khi monitoring phát hiện khả năng vi phạm security boundary nghiêm trọng, safety, security và research team được page. Nếu trong 30 phút không kết luận được đó là false positive, họ phải pause activity.

Monitoring này được yêu cầu cho mọi RL training và eval có tool liên quan tới model từ năng lực Sol trở lên. Từ ngày 7/8, khi Astra có thể chạm mức cyber-critical, OpenAI thêm yêu cầu monitoring cho mọi inference của Astra có tool.

Chi phí cũng được nêu thẳng: monitoring overhead hiện được ước tính khoảng 20% inference compute của phần đang được theo dõi, dù mức này thay đổi theo workload.

Ý nghĩa với Dev

Thông điệp thực dụng không phải là mọi team đều cần hệ thống monitoring như frontier lab. Thông điệp là agent có tool access đang biến sandbox, logging, least privilege và kill switch thành yêu cầu sản phẩm.

Nếu team của bạn cho model chạy code, gọi internal API, đọc ticket, mở browser hoặc động vào network, hãy coi môi trường đó là untrusted workload. Cần tối thiểu:

OpenAI đang trả thêm compute để mua quan sát và thời gian phản ứng. Với hệ thống nhỏ hơn, bài học vẫn giống nhau: đừng để agent có quyền thật trước khi bạn có telemetry thật.


Đường dẫn nguồn

tinAI dịch bài này sang tiếng Việt từ Pacing model development in an era of cyber-critical capabilities (openai.com) · Loại nguồn: công ty/blog và giữ bối cảnh từ bản tin tinAI đã giới thiệu bài này .

Bản tin này có 3 bài dịch liên quan từ cùng bản tin.

Đọc tiếp từ đây

Bạn có thể quay lại bản tin nguồn hoặc mở kho bài dịch để đọc tiếp.

Các bài bên dưới cùng xuất hiện trong bản tin nguồn, nên giữ chung bối cảnh đọc với bài này.

Các bài liên quan trong cùng bản tin trải trên 2 loại nguồn (2 bài). Loại nguồn: GitHub 1 Loại nguồn: web 1