Mistral Ra Shieldstral — Model An Toàn Đa Phương Thức 3 Tỉ Tham Số
2 phút đọc

Shieldstral dựa trên Ministral-3B kết hợp với bộ mã hóa thị giác Pixtral và được thiết kế để phân loại đầu ra của model khác theo chính sách do người vận hành định nghĩa bằng câu hỏi ngôn ngữ tự nhiên tại thời gian chạy. Model trả về một token duy nhất là "yes" hoặc "no" và hệ thống dùng xác suất phản hồi để tính điểm an toàn từ 0 đến 1.
Nhóm tác giả gom khoảng 54.1 triệu ví dụ liên quan đến an toàn, nội dung có hại và nỗ lực thao túng vào một định dạng chung. Họ áp dụng tiêu chuẩn nghiêm khắc cho thao túng mục tiêu, tiêu chuẩn vừa phải cho dữ liệu an toàn tổng quát và tiêu chuẩn nhẹ cho chất lượng phản hồi. Để dạy model phân biệt tinh vi hơn, đội ngũ dùng một model ngôn ngữ khác viết lại văn bản an toàn thành biến thể không an toàn và thêm các cặp đối chứng để huấn luyện việc phân tách các quy tắc gần nhau.
Trên các bộ kiểm tra văn bản tổng hợp, Shieldstral đạt điểm F1 là 84.9%. Kết quả này ngang bằng GPT-OSS-Safeguard-20B (20 tỉ tham số) và vượt Qwen3Guard-8B (84.0%), Nemotron-3.5-Safety-4B (83.3%) và LlamaGuard-4-12B (69.1%). Với dữ liệu hình ảnh và kết hợp văn bản-hình ảnh, Shieldstral đạt 83.8%, cao hơn OmniGuard-7B (77.6%) và LlavaGuard-7B (71.6%).
Trong bài kiểm tra thích ứng, GPT-OSS-Safeguard-20B dẫn đầu với 94.1% so với Shieldstral 91.3%. Các tác giả cho rằng Shieldstral thực tế hơn một số model khác vì trả về một từ duy nhất thay vì chuỗi suy luận dài, giúp giảm chi phí tính toán.
Nguồn
- Mistral's open model Shieldstral matches much larger safety models at a fraction of the size— The Decoder, 5 tháng 8, 2026
- Mistral introduces Shieldstral to provide lightweight policy-aware moderation for AI models— SiliconANGLE, 5 tháng 8, 2026
- Mistral Is in the Right Place at the Right Time— WIRED, 4 tháng 8, 2026