ModelKeamanan AI 🇫🇷 06.08.2026 20:01

Mistral meluncurkan model terbuka untuk mengendalikan konten yang dihasilkan AI

MistralMistral
Mistral telah meluncurkan Shieldstral, model keamanan multimodal sumber terbuka dengan 3 miliar parameter yang dirancang untuk mendeteksi konten berisiko dan menegakkan kebijakan tata kelola. Model ini berjalan pada satu GPU Nvidia dengan memori 16 GB dan diterbitkan di bawah lisensi Apache 2.0. Pengembang dapat mendefinisikan aturan kontrol menggunakan pertanyaan bahasa alami.
Di tengah semakin banyaknya penggunaan asisten AI generatif di perusahaan, kontrol konten menjadi isu utama. Untuk mengatasinya, Mistral telah meluncurkan Shieldstral, model keamanan multimodal dengan bobot terbuka berparameter 3 miliar yang dirancang untuk mengidentifikasi konten berisiko dan menerapkan kebijakan tata kelola yang sesuai. Model ini mendukung 12 bahasa. Diterbitkan di bawah lisensi Apache 2.0, model ini membuat bobotnya tersedia bagi pengembang untuk integrasi dan adaptasi yang mudah, dan dapat dijalankan pada satu GPU Nvidia dengan memori video 16 GB. Shieldstral tersedia untuk diunduh di Hugging Face. Tidak seperti sistem penyaringan tradisional yang dilatih pada kategori yang telah ditentukan seperti kekerasan, ujaran kebencian, penipuan, atau konten seksual eksplisit, Shieldstral menggunakan pendekatan yang dapat dikonfigurasi di mana pengembang dapat mendefinisikan aturan kontrol sebagai pertanyaan bahasa alami, misalnya, 'Apakah konten ini menghasut kekerasan fisik?' Permintaan dapat dilengkapi dengan instruksi yang menentukan konteks analisis, tingkat keparahan yang diharapkan, atau sifat konten (teks atau gambar). Model ini menyediakan evaluasi keamanan biner, menghasilkan hanya satu token untuk keputusan akhir berdasarkan probabilitas jawaban 'ya' dan 'tidak'. Model ini dapat digunakan pada berbagai tahap pemrosesan AI, baik sebelum mengirim permintaan pengguna ke model generatif atau setelah generasi untuk memeriksa respons sebelum dipublikasikan. Menurut Mistral, Shieldstral berkinerja sama baiknya atau lebih baik daripada model penjaga terbuka yang ukurannya hingga tujuh kali lebih besar di beberapa tolok ukur, terutama dalam keamanan teks, deteksi penolakan, dan evaluasi multimodal, mencapai skor global rata-rata 84,9% pada penilaian keamanan teks dan 83,8% pada tes keamanan multimodal termasuk analisis gambar.
Sumber: Le Monde Informatique — IA — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru