An toàn AIMô hình 🇩🇪 06.08.2026 17:02

Mistral phát hành mô hình với kỹ thuật mới trong phân loại an toàn

MistralMistral
Mistral AI đã giới thiệu Shieldstral, một mô hình an toàn sử dụng phương pháp hỏi-đáp linh hoạt để kiểm duyệt nội dung do AI tạo ra. Thay vì các danh mục cố định, các nhà vận hành định nghĩa các chính sách kiểm duyệt dưới dạng các câu hỏi có/không bằng ngôn ngữ tự nhiên, và Shieldstral trả về điểm an toàn. Mô hình đạt hiệu suất tương đương với các mô hình lớn gấp bảy lần trong khi chạy trên GPU Nvidia 16 GB.
Mistral AI đã giới thiệu Shieldstral, một mô hình an toàn được thiết kế để đơn giản hóa việc kiểm duyệt nội dung do AI tạo ra. Mô hình này sử dụng phương pháp hỏi-đáp linh hoạt thay vì các danh mục cố định: người vận hành xây dựng chính sách kiểm duyệt của họ dưới dạng các câu hỏi có/không bằng ngôn ngữ tự nhiên, chẳng hạn như "Nội dung này có kêu gọi bạo lực thực sự không?", và Shieldstral trả về điểm số an toàn dựa trên đó để phê duyệt hoặc từ chối lời nhắc hoặc phản hồi của AI. Theo Mistral, phương pháp này có hai lợi thế: thứ nhất, người vận hành có thể dễ dàng điều chỉnh các câu hỏi về nội dung bất cứ lúc nào; thứ hai, phương pháp này có thể đánh giá ngữ cảnh của nội dung tốt hơn. Ví dụ, những gì có thể là trích dẫn gốc cần thiết từ các bài phát biểu đương thời trong một bài giảng ở trường về trại tập trung sẽ bị chỉ trích nặng nề nếu là nội dung cho một bài đăng trên blog cá nhân. Các tác giả của bài báo liên quan lập luận rằng các mô hình bảo vệ (guardrail) trước đây với phân loại cố định không thể nắm bắt đầy đủ những khác biệt về ngữ cảnh như vậy vì tính cho phép thường gắn với các danh mục. Đầu vào coi việc kiểm duyệt như một nhiệm vụ trả lời câu hỏi nhị phân: mô hình nhận được hướng dẫn hệ thống, ngữ cảnh và câu hỏi có/không, và trong quá trình suy luận chỉ xuất ra logit của "có" và "không", được chuẩn hóa qua softmax thành điểm số an toàn liên tục. Mistral tuyên bố Shieldstral đạt được hiệu suất tương đương với các mô hình lớn gấp bảy lần nhưng chạy trên GPU Nvidia 16 GB. Về mặt kỹ thuật, Shieldstral dựa trên Ministral-3B-Base-2512, một mô hình ngôn ngữ nhân quả thuộc gia đình Mistral, gần đây đã được mở rộng với Leanstral 1.5, tối ưu hóa cho chứng minh toán học và xác minh chính thức. Đối với xử lý hình ảnh, mã hóa hình ảnh Pixtral-Vision-Encoder được sử dụng. Mô hình 3 tỷ tham số có sẵn để tải xuống dưới dạng Open Weights theo giấy phép Apache-2.0 trên Hugging Face.
Nguồn: Heise online — bản gốc
Bài viết liên quan trước đây ↓
Tin mới