ModellerYapay Zeka Güvenliği 🇩🇪 05.08.2026 20:02

Shieldstral: Mistral’ın Küçük Açık Kaynaklı Modeli Çok Daha Büyük Güvenlik Sınıflandırıcılarını Geride Bıraktı

MistralMistral OpenAIOpenAI
Mistral’dan yeni bir makale, 3 milyar parametreli Shieldstral modelinin metin kıyaslamalarında çok daha büyük güvenlik sınıflandırıcılarının performansına eşit olduğunu ve çok modlu sınıflandırmada bir rekor kırdığını gösteriyor. Shieldstral, operatörlerin yeniden eğitim gerektirmeden kendi güvenlik kriterlerini tanımlamasına olanak tanıyan basit bir evet/hayır soru formatı kullanıyor.
Yeni bir makaleye göre, Fransız yapay zeka şirketi Mistral'in 3 milyar parametreli modeli Shieldstral, yaygın metin güvenliği karşılaştırmalarında kendisinden üç kat büyük modellerin performansına ulaşıyor. Metin ve görüntülerin eşzamanlı sınıflandırılmasında ise yeni bir en iyi sonuç elde ettiği iddia ediliyor. Mevcut güvenlik modelleri sıklıkla sabit kategori sistemleri kullanıyor; Mistral'in kurucu ortaklarından Guillaume Lample'ın da aralarında bulunduğu yazarlar, bu durumun iki zayıflık barındırdığını görüyor: genel güvenlik veri setleri kategorileri açısından fazlasıyla heterojen ve sabit kategoriler belirli kullanım senaryosuna uyum sağlayamıyor. Shieldstral, içerik denetimini evet/hayır sorusuna indirgiyor: operatörler doğal dilde neyin kontrol edilmesi gerektiğini formüle ediyor, örneğin "Bu içerik şiddeti teşvik ediyor mu?" ve model yalnızca evet veya hayır ile yanıtlıyor. Sistem, her iki yanıtın olasılıklarından sıfır ile bir arasında bir güvenlik puanı hesaplıyor. Araştırmacılar, çeşitli güvenlik, zararlı içerik ve manipülasyon girişimi veri setlerinden yaklaşık 54,1 milyon örneği birleşik bir formata dönüştürdü. Modele daha ince ayrımları öğretmek için başka bir dil modeli, güvenli metinleri güvenli olmayan varyantlara yeniden yazdı ve her örneğe, açıkça uygulanmaması gereken benzer ancak farklı bir kategori eşlik etti. Bu sayede Shieldstral, yalnızca güvenli ve güvenli olmayan arasında kaba bir ayrım yapmak yerine, yakından ilişkili kuralları birbirinden ayırt etmeyi öğrendi. Birleşik metin karşılaştırmalarında Shieldstral yüzde 84,9 F1 puanına ulaşarak, yaklaşık yedi kat daha büyük olan OpenAI'in GPT-OSS-Safeguard-20B modeliyle eşitleniyor ve Qwen3Guard-8B (84,0), Nemotron-3.5-Safety-4B (83,3) ve LlamaGuard-4-12B (69,1) modellerini geride bırakıyor. Görüntü ve görüntü-metin kombinasyonlarında ise yüzde 83,8 puan alarak OmniGuard-7B (77,6) ve LlavaGuard-7B (71,6) modellerini geride bırakıyor. Uyarlama karşılaştırmasında GPT-OSS-Safeguard-20B, yüzde 94,1 ile Shieldstral'in yüzde 91,3'üne kıyasla öne geçiyor; ancak yazarlar, kendi modellerinin daha pratik olduğunu çünkü diğerlerinin uzun ara adımlar üreterek hesaplama maliyetlerini artırdığını, Shieldstral'in ise yalnızca tek bir kelime çıktısı verdiğini savunuyor. Shieldstral, Mistral'in Ministral-3B modeline ve Pixtral görüntü tanıma yeteneğine dayanıyor. İnce taneli kategoriler için doğrulama seti üzerinde yapılan bir testte, sentetik kategori verileri F1 puanını yüzde 23,3 puan artırdı. Shieldstral, Apache-2.0 lisansı altında açık ağırlıklı bir model olarak sunuluyor. Güvenlik sınıflandırıcıları, gerçek dil modelinin önünde ve arkasında yer alan ve giriş ile çıkışları kontrol eden bir doğrulama katmanıdır. Avantajı, kuralların yeniden eğitim gerektirmeden değiştirilebilmesidir; ancak kontrol her istekte çalıştığı için sınıflandırıcının boyutu, hızı ve maliyeti önem taşır. Shieldstral'in temel argümanı, operatörlerin çalışma zamanında kendi kriterlerini formüle edebilmesiyle, harici bir kategori sistemine tabi olmak yerine filtrenin kendi uygulamalarına göre ayarlanabilmesidir.
Kaynak: The Decoder (DE) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler