Mistral AI Merilis Shieldstral: Pengklasifikasi Keamanan Multimodal yang Adaptif terhadap Kebijakan
Mistral
Mistral AI telah memperkenalkan Shieldstral, pengklasifikasi keamanan multimodal dengan 3 miliar parameter dan bobot terbuka yang membingkai moderasi konten sebagai tugas tanya-jawab yang adaptif terhadap kebijakan. Model ini mengungguli model hingga 7 kali ukurannya, menerima kebijakan dalam bahasa sehari-hari saat inferensi, dan berjalan pada satu GPU NVIDIA 16GB, semuanya di bawah lisensi Apache 2.0.
Shieldstral adalah pengklasifikasi keamanan multimodal open-weights 3B yang dirilis oleh Mistral AI di bawah lisensi Apache 2.0. Tidak seperti model guardrail tradisional yang menyematkan taksonomi tetap kategori bahaya ke dalam bobotnya, Shieldstral mengambil pendekatan baru: pengguna menulis kebijakan keamanan sebagai pertanyaan bahasa sehari-hari pada waktu inferensi, dan model mengembalikan skor keamanan yang terkalibrasi. Formulasi ini menyatukan klasifikasi prompt, moderasi respons, deteksi penolakan, dan deteksi toksisitas menjadi satu masalah tunggal, dan bekerja untuk teks dan gambar tanpa pelatihan ulang. Model ini menyamai atau melampaui model penjaga terbuka hingga 7 kali ukurannya di berbagai tolok ukur keamanan teks, deteksi penolakan, adaptabilitas kebijakan, dan multimodal. Model ini berjalan efisien pada satu GPU NVIDIA 16GB. Proses pelatihan melibatkan penyatuan beragam set data keamanan publik, pengajaran diskriminasi melalui pasangan kontrastif yang dihasilkan oleh LLM, penanaman keamanan dalam gambar dengan peringkat ulang visi-bahasa, dan penggabungan checkpoint yang saling melengkapi melalui LoRA dan SLERP. Mistral AI membangun Shieldstral dari awal hingga akhir di platform Forge-nya. Perusahaan terus mengerjakan cakupan multibahasa, ketahanan dokumen yang lebih panjang, dan keamanan multimodal yang lebih luas. Mistral AI juga merupakan anggota perdana dari Open Secure AI Alliance bersama NVIDIA dan organisasi lainnya.
Sumber: Mistral AI —
asli
