Mistral merilis model dengan teknik baru untuk klasifikasi keamanan
Mistral
Mistral AI telah memperkenalkan Shieldstral, sebuah model keamanan yang menggunakan pendekatan tanya-jawab yang fleksibel untuk memoderasi konten yang dihasilkan oleh AI. Alih-alih menggunakan kategori tetap, operator mendefinisikan kebijakan moderasi sebagai pertanyaan ya/tidak dalam bahasa alami, dan Shieldstral mengembalikan skor keamanan. Model ini mencapai kinerja yang sebanding dengan model tujuh kali lebih besar sambil berjalan pada GPU Nvidia 16 GB.
Mistral AI telah memperkenalkan Shieldstral, sebuah model keamanan yang dirancang untuk menyederhanakan moderasi konten yang dihasilkan oleh AI. Model ini menggunakan pendekatan tanya-jawab yang fleksibel alih-alih kategori tetap: operator merumuskan kebijakan moderasi mereka sebagai pertanyaan ya/tidak dalam bahasa alami, seperti "Apakah konten ini menyerukan kekerasan nyata?", dan Shieldstral mengembalikan skor keamanan yang menjadi dasar persetujuan atau penolakan prompt atau respons AI. Menurut Mistral, metode ini memiliki dua kelebihan: pertama, operator dapat dengan mudah menyesuaikan pertanyaan yang diajukan tentang konten kapan saja; kedua, metode ini dapat lebih baik menilai konteks konten. Misalnya, apa yang mungkin merupakan kutipan asli yang diperlukan dari pidato kontemporer dalam kuliah sekolah tentang kamp konsentrasi akan menjadi sangat kritis sebagai konten untuk posting blog pribadi. Para penulis makalah terkait berpendapat bahwa model guardrail sebelumnya dengan taksonomi tetap tidak dapat menangkap perbedaan kontekstual seperti itu secara memadai karena izin sering kali terkait dengan kategori. Input memperlakukan moderasi sebagai tugas menjawab pertanyaan biner: model menerima instruksi sistem, konteks, dan pertanyaan ya/tidak, dan selama inferensi hanya mengeluarkan logits ya dan tidak, yang dinormalisasi melalui softmax menjadi skor keamanan kontinu. Mistral mengklaim Shieldstral mencapai kinerja yang sama dengan model tujuh kali lebih besar tetapi berjalan pada GPU Nvidia 16 GB. Secara teknis, Shieldstral didasarkan pada Ministral-3B-Base-2512, model bahasa kausal dari keluarga Mistral sendiri, yang baru-baru ini diperluas dengan Leanstral 1.5, yang dioptimalkan untuk pembuktian matematika dan verifikasi formal. Untuk pemrosesan gambar, digunakan Pixtral-Vision-Encoder. Model 3 miliar parameter ini tersedia untuk diunduh sebagai Open Weights di bawah lisensi Apache-2.0 di Hugging Face.
Sumber: Heise online —
asli
