ModelKeamanan AI 🇩🇪 05.08.2026 20:02

Shieldstral: Model Open-Weight Kecil dari Mistral Mengalahkan Klasifikasi Keamanan yang Jauh Lebih Besar

MistralMistral OpenAIOpenAI
Sebuah makalah baru dari Mistral menunjukkan bahwa model Shieldstral dengan 3 miliar parameter mampu menyamai kinerja klasifikasi keamanan yang jauh lebih besar pada tolok ukur teks dan mencetak rekor pada klasifikasi multimodal. Shieldstral menggunakan format pertanyaan ya/tidak sederhana, yang memungkinkan operator untuk menentukan kriteria keamanan mereka sendiri tanpa pelatihan ulang.
Menurut sebuah makalah baru, Shieldstral, model 3 miliar parameter dari perusahaan AI Prancis Mistral, mencapai kinerja pada tolok ukur keamanan teks umum yang setara dengan model tiga kali lebih besar. Untuk klasifikasi simultan teks dan gambar, model ini mengklaim menetapkan hasil terbaik baru. Model keamanan yang ada sering menggunakan sistem kategori tetap, yang oleh para penulis, termasuk salah satu pendiri Mistral Guillaume Lample, dilihat memiliki dua kelemahan: dataset keamanan publik terlalu heterogen dalam kategorinya, dan kategori tetap tidak beradaptasi dengan kasus penggunaan spesifik. Shieldstral menyederhanakan moderasi konten menjadi pertanyaan ya/tidak: operator merumuskan dalam bahasa alami apa yang harus diperiksa, misalnya, 'Apakah konten ini mempromosikan kekerasan?', dan model hanya merespons dengan ya atau tidak. Sistem menghitung skor keamanan antara nol dan satu dari probabilitas kedua jawaban. Para peneliti menggabungkan sekitar 54,1 juta contoh dari berbagai dataset tentang keamanan, konten berbahaya, dan upaya manipulasi ke dalam format terpadu. Untuk mengajarkan model perbedaan yang lebih halus, mereka meminta model bahasa lain untuk menulis ulang teks aman menjadi varian tidak aman, dan setiap contoh disertai dengan kategori serupa tetapi berbeda yang secara eksplisit tidak boleh diterapkan. Ini mengajarkan Shieldstral untuk membedakan antara aturan yang terkait erat daripada hanya secara kasar antara aman dan tidak aman. Pada tolok ukur teks gabungan, Shieldstral mencapai skor F1 84,9 persen, sejajar dengan GPT-OSS-Safeguard-20B dari OpenAI yang sekitar tujuh kali lebih besar dan melampaui Qwen3Guard-8B (84,0), Nemotron-3.5-Safety-4B (83,3), dan LlamaGuard-4-12B (69,1). Untuk gambar dan kombinasi gambar-teks, model ini mencetak 83,8 persen, mengungguli OmniGuard-7B (77,6) dan LlavaGuard-7B (71,6). Pada tolok ukur adaptasi, GPT-OSS-Safeguard-20B memimpin dengan 94,1 persen versus Shieldstral 91,3, tetapi para penulis berpendapat bahwa model mereka lebih praktis karena yang lain menghasilkan langkah perantara yang panjang, meningkatkan biaya komputasi, sementara Shieldstral hanya mengeluarkan satu kata. Shieldstral didasarkan pada Ministral-3B dari Mistral dengan pengenalan gambar Pixtral. Dalam uji pada set validasi untuk kategori yang terperinci, data kategori sintetis meningkatkan skor F1 sebesar 23,3 poin persentase. Shieldstral tersedia sebagai model open-weights di bawah lisensi Apache-2.0. Pengklasifikasi keamanan adalah lapisan validasi yang berada sebelum dan sesudah model bahasa yang sebenarnya, memeriksa input dan output. Keuntungannya adalah bahwa aturan dapat diubah tanpa pelatihan ulang, tetapi pemeriksaan berjalan pada setiap permintaan, sehingga ukuran, kecepatan, dan biaya pengklasifikasi menjadi penting. Argumen inti Shieldstral adalah bahwa jika operator dapat merumuskan kriteria mereka sendiri saat runtime, mereka dapat menyetel filter untuk aplikasi mereka alih-alih tunduk pada sistem kategori asing.
Sumber: The Decoder (DE) — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru