Mistral AI ra mắt Shieldstral 1.0 3B: Bộ phân loại an toàn đa phương thức mã nguồn mở vượt trội hơn các mô hình lớn gấp 7 lần
Mistral
Mistral AI đã phát hành Shieldstral 1.0 3B, một bộ phân loại an toàn đa phương thức mã nguồn mở, có khả năng thích ứng chính sách. Mô hình này coi việc kiểm duyệt nội dung như một câu hỏi có/không duy nhất thay vì một phân loại cố định về các loại tác hại. Mô hình này tương đương với GPT-OSS-Safeguard-20B về an toàn văn bản và dẫn đầu về an toàn đa phương thức.
Mistral AI đã phát hành Shieldstral 1.0 3B, một bộ phân loại an toàn đa phương thức mã nguồn mở, có thể thích ứng theo chính sách, xử lý kiểm duyệt nội dung như một câu hỏi có/không duy nhất thay vì một phân loại cố định các loại tác hại. Không giống như hầu hết các mô hình bảo vệ (guardrail) nhúng các loại tác hại vào trọng số của chúng, Shieldstral cho phép người vận hành viết chính sách dưới dạng một câu hỏi bằng ngôn ngữ tự nhiên tại thời điểm suy luận, trả về điểm an toàn đã hiệu chỉnh từ một lần truyền thẳng. Được xây dựng trên Ministral-3-3B-Base-2512 với bộ mã hóa thị giác Pixtral gốc và phát hành theo giấy phép Apache 2.0, mô hình này báo cáo chỉ số F1 trung bình 84,9% về an toàn văn bản, ngang bằng với GPT-OSS-Safeguard-20B, và 83,8% về an toàn đa phương thức, vượt qua tất cả các mô hình cơ sở mà Mistral đã đánh giá. Mô hình phù hợp với 16GB VRAM ở định dạng BF16, chạy trên một GPU duy nhất và hỗ trợ vLLM, llama.cpp, SGLang và Transformers. Dữ liệu huấn luyện của nó bao gồm khoảng 54,1 triệu mẫu, với việc tạo sinh tương phản (contrastive generation) tạo ra các mẫu âm khó để dạy các vi phạm cụ thể theo chính sách. Điểm yếu bao gồm hiệu suất thấp hơn trên các ngôn ngữ ít tài nguyên như tiếng Ả Rập và tiếng Indonesia, và độ tin cậy giảm trên các đầu vào đối nghịch hoặc bị che giấu và các tài liệu rất dài.
Nguồn: MarkTechPost —
bản gốc
