Giới thiệu
Shieldstral là model moderation multimodal 3B mà Mistral phát hành dưới Apache 2.0. Bài launch mô tả nó như một safety classifier policy-adaptive: thay vì đóng băng toàn bộ taxonomy an toàn vào weights, hệ thống đưa policy vào prompt ở thời điểm inference.
Đầu vào của model gồm instruction, một câu hỏi yes/no và document cần đánh giá. Document có thể là prompt, response, cặp prompt-response, hoặc image kèm text. Model chỉ đọc logit yes/no, chuẩn hóa thành safety score liên tục, rồi sản phẩm tự quyết ngưỡng phù hợp.
Tính năng chính
Điểm thiết kế quan trọng là cùng một checkpoint có thể xử lý nhiều bài toán moderation khác nhau: phân loại prompt, kiểm tra response, phát hiện refusal, đánh giá toxicity và kiểm tra nội dung hình ảnh. Policy được viết bằng ngôn ngữ tự nhiên nên dễ đổi theo domain hơn taxonomy cố định.
Mistral nói Shieldstral chạy trên một GPU NVIDIA 16 GB, dùng dữ liệu huấn luyện thật và synthetic từ nhiều nguồn nhãn khác nhau, rồi chuyển chúng về cùng format instruction-query-document. Họ cũng tạo các cặp policy dễ nhầm để model học phân biệt ranh giới policy, thay vì chỉ thuộc vài label có sẵn.
Cách dev có thể dùng
Với đội đang build sản phẩm AI, Shieldstral đáng xem khi bạn cần một moderation layer tự host, có thể audit policy bằng text, và muốn cùng một interface cho text lẫn image. Ví dụ, một platform cybersecurity có thể đặt strictness khác với một ứng dụng giáo dục hoặc mental-health, mà không phải fine-tune lại model cho mỗi taxonomy.
Điểm cần thận trọng: policy viết bằng ngôn ngữ tự nhiên không tự biến evaluation thành đúng. Dev vẫn cần bộ test riêng, ví dụ xấu gần domain thật, logging để xem threshold hoạt động ra sao, và quy trình review khi guardrail từ chối sai hoặc bỏ lọt nội dung nguy hiểm. Shieldstral làm moderation linh hoạt hơn; nó không miễn phí phần kiểm chứng.