Mô hìnhAn toàn AI 🇩🇪 05.08.2026 20:02

Shieldstral: Mô hình mã nguồn mở nhỏ của Mistral vượt qua các bộ phân loại an toàn lớn hơn nhiều

MistralMistral OpenAIOpenAI
Một bài báo mới từ Mistral cho thấy mô hình Shieldstral 3 tỷ tham số của họ đạt hiệu suất tương đương với các bộ phân loại an toàn lớn hơn nhiều trên các tiêu chuẩn văn bản và lập kỷ lục về phân loại đa phương thức. Shieldstral sử dụng định dạng câu hỏi có/không đơn giản, cho phép người vận hành tự xác định tiêu chí an toàn mà không cần huấn luyện lại.
Theo một bài báo mới, Shieldstral, mô hình 3 tỷ tham số của công ty AI Pháp Mistral, đạt được hiệu suất trên các chuẩn đánh giá an toàn văn bản thông thường tương đương với các mô hình lớn gấp ba lần. Đối với phân loại đồng thời văn bản và hình ảnh, nó tuyên bố thiết lập kết quả tốt nhất mới. Các mô hình an toàn hiện có thường sử dụng hệ thống danh mục cố định, mà các tác giả, bao gồm cả đồng sáng lập Mistral Guillaume Lample, coi là có hai điểm yếu: các bộ dữ liệu an toàn công khai quá không đồng nhất về danh mục, và danh mục cố định không thích ứng với trường hợp sử dụng cụ thể. Shieldstral đơn giản hóa việc kiểm duyệt nội dung thành câu hỏi có/không: người vận hành diễn đạt bằng ngôn ngữ tự nhiên những gì cần kiểm tra, ví dụ: "Nội dung này có cổ vũ bạo lực không?", và mô hình chỉ trả lời có hoặc không. Hệ thống tính điểm an toàn từ 0 đến 1 dựa trên xác suất của cả hai câu trả lời. Các nhà nghiên cứu đã kết hợp khoảng 54,1 triệu ví dụ từ nhiều bộ dữ liệu khác nhau về an toàn, nội dung có hại và các nỗ lực thao túng thành một định dạng thống nhất. Để dạy mô hình phân biệt tinh tế hơn, họ đã cho một mô hình ngôn ngữ khác viết lại các văn bản an toàn thành các biến thể không an toàn, và mỗi ví dụ đi kèm với một danh mục tương tự nhưng khác biệt mà rõ ràng không nên áp dụng. Điều này dạy Shieldstral phân biệt giữa các quy tắc liên quan chặt chẽ thay vì chỉ phân biệt thô giữa an toàn và không an toàn. Trên chuẩn đánh giá văn bản tổng hợp, Shieldstral đạt điểm F1 là 84,9 phần trăm, ngang bằng với GPT-OSS-Safeguard-20B của OpenAI (lớn hơn khoảng bảy lần) và vượt qua Qwen3Guard-8B (84,0), Nemotron-3.5-Safety-4B (83,3) và LlamaGuard-4-12B (69,1). Đối với hình ảnh và kết hợp hình ảnh-văn bản, nó đạt 83,8 phần trăm, đánh bại OmniGuard-7B (77,6) và LlavaGuard-7B (71,6). Trên chuẩn đánh giá thích ứng, GPT-OSS-Safeguard-20B dẫn đầu với 94,1 phần trăm so với 91,3 của Shieldstral, nhưng các tác giả lập luận rằng mô hình của họ thực tế hơn vì các mô hình khác tạo ra các bước trung gian dài, làm tăng chi phí tính toán, trong khi Shieldstral chỉ xuất ra một từ duy nhất. Shieldstral dựa trên Ministral-3B của Mistral với khả năng nhận dạng hình ảnh Pixtral. Trong một thử nghiệm trên tập xác thực cho các danh mục chi tiết, dữ liệu danh mục tổng hợp làm tăng điểm F1 thêm 23,3 điểm phần trăm. Shieldstral có sẵn dưới dạng mô hình trọng số mở theo giấy phép Apache-2.0. Bộ phân loại an toàn là một lớp xác thực nằm trước và sau mô hình ngôn ngữ thực tế, kiểm tra đầu vào và đầu ra. Ưu điểm là các quy tắc có thể được thay đổi mà không cần đào tạo lại, nhưng việc kiểm tra chạy trên mọi yêu cầu, vì vậy kích thước, tốc độ và chi phí của bộ phân loại rất quan trọng. Lập luận cốt lõi của Shieldstral là nếu người vận hành có thể tự xây dựng tiêu chí của họ tại thời điểm chạy, họ có thể điều chỉnh bộ lọc cho ứng dụng của mình thay vì bị ràng buộc bởi một hệ thống danh mục bên ngoài.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới