ModelKeamanan AI 🇺🇸 09.08.2026 23:01

Mistral AI Meluncurkan Shieldstral 1.0 3B: Klasifikasi Keamanan Multimodal dengan Bobot Terbuka yang Mengungguli Model 7 Kali Lebih Besar

MistralMistral
Mistral AI telah merilis Shieldstral 1.0 3B, sebuah pengklasifikasi keamanan multimodal dengan bobot terbuka dan adaptif terhadap kebijakan. Alat ini memperlakukan moderasi konten sebagai satu pertanyaan ya/tidak, bukan taksonomi kategori bahaya yang tetap. Model ini setara dengan GPT-OSS-Safeguard-20B dalam keamanan teks dan unggul dalam keamanan multimodal.
Mistral AI telah merilis Shieldstral 1.0 3B, sebuah pengklasifikasi keamanan multimodal adaptif-kebijakan dengan bobot terbuka yang memperlakukan moderasi konten sebagai pertanyaan ya/tidak tunggal, bukan taksonomi tetap kategori bahaya. Berbeda dengan kebanyakan model penjaga yang memanggang kategori bahaya ke dalam bobotnya, Shieldstral memungkinkan operator menulis kebijakan sebagai pertanyaan dalam bahasa sehari-hari pada saat inferensi, mengembalikan skor keamanan yang dikalibrasi dari satu operan maju. Dibangun di atas Ministral-3-3B-Base-2512 dengan encoder visi Pixtral asli dan dirilis di bawah lisensi Apache 2.0, model ini melaporkan F1 rata-rata 84,9% pada keamanan teks, sebanding dengan GPT-OSS-Safeguard-20B, dan 83,8% pada keamanan multimodal, melampaui semua baseline yang dievaluasi Mistral. Model ini muat dalam RAM 16GB pada BF16, berjalan pada satu GPU, dan mendukung vLLM, llama.cpp, SGLang, dan Transformers. Data pelatihannya mencakup sekitar 54,1 juta sampel, dengan pembuatan kontrastif menciptakan negatif sulit untuk mengajarkan pelanggaran spesifik kebijakan. Kelemahannya termasuk kinerja yang lebih rendah pada bahasa dengan sumber daya rendah seperti bahasa Arab dan Indonesia, serta keandalan yang berkurang pada input adversarial atau yang diobfuskasi dan dokumen yang sangat panjang.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru