Mô hìnhAn toàn AI 🇺🇸 04.08.2026 17:03

Mistral AI phát hành Shieldstral: Bộ phân loại an toàn đa phương thức thích ứng chính sách

MistralMistral
Mistral AI đã giới thiệu Shieldstral, một bộ phân loại an toàn đa phương thức mã nguồn mở với 3 tỷ tham số, định hình việc kiểm duyệt nội dung như một nhiệm vụ hỏi đáp thích ứng chính sách. Nó vượt trội so với các mô hình lớn gấp 7 lần, chấp nhận chính sách ngôn ngữ tự nhiên tại thời điểm suy luận và chạy trên một GPU NVIDIA 16GB duy nhất, tất cả dưới giấy phép Apache 2.0.
Shieldstral là một bộ phân loại an toàn đa phương thức mã nguồn mở 3B do Mistral AI phát hành theo giấy phép Apache 2.0. Không giống như các mô hình bảo vệ truyền thống, vốn nhúng một hệ phân loại cố định các loại tác hại vào trọng số của chúng, Shieldstral áp dụng cách tiếp cận mới: người dùng viết chính sách an toàn dưới dạng câu hỏi ngôn ngữ tự nhiên tại thời điểm suy luận, và mô hình trả về điểm an toàn đã được hiệu chuẩn. Công thức này hợp nhất việc phân loại lời nhắc, kiểm duyệt phản hồi, phát hiện từ chối và phát hiện độc hại thành một vấn đề duy nhất, và hoạt động hiệu quả cho cả văn bản lẫn hình ảnh mà không cần huấn luyện lại. Mô hình này đạt hoặc vượt hiệu suất của các mô hình bảo vệ mã nguồn mở có kích thước lớn hơn tới 7 lần trên các bài kiểm tra an toàn văn bản, phát hiện từ chối, khả năng thích ứng chính sách và đa phương thức. Nó chạy hiệu quả trên một GPU NVIDIA 16GB. Quy trình huấn luyện bao gồm việc hợp nhất các tập dữ liệu an toàn công khai không đồng nhất, dạy cách phân biệt thông qua các cặp đối lập do LLM tạo ra, gắn kết an toàn với hình ảnh bằng cách xếp hạng lại thị giác-ngôn ngữ, và kết hợp các điểm kiểm tra bổ sung thông qua LoRA và SLERP. Mistral AI đã xây dựng Shieldstral từ đầu đến cuối trên nền tảng Forge của mình. Công ty đang tiếp tục nghiên cứu về phạm vi đa ngôn ngữ, khả năng xử lý tài liệu dài và an toàn đa phương thức rộng hơn. Mistral AI cũng là thành viên sáng lập của Liên minh AI an toàn mở (Open Secure AI Alliance) cùng với NVIDIA và các tổ chức khác.
Nguồn: Mistral AI — bản gốc
Bài viết liên quan trước đây ↓
Tin mới