Mistral AI, 7 Kat Büyüklüğündeki Modelleri Geride Bırakan Açık Ağırlıklı Çok Modlu Güvenlik Sınıflandırıcısı Shieldstral 1.0 3B'yi Tanıttı
Mistral
Mistral AI, açık ağırlıklara sahip, politikaya uyum sağlayabilen çok modlu bir güvenlik sınıflandırıcısı olan Shieldstral 1.0 3B'yi yayınladı. İçerik denetimini sabit bir zarar kategorileri taksonomisi yerine tek bir evet/hayır sorusu olarak ele alıyor. Model, metin güvenliğinde GPT-OSS-Safeguard-20B ile eşleşiyor ve çok modlu güvenlikte öne çıkıyor.
Mistral AI, açık ağırlıklı ve politikaya uyarlanabilir çok modlu bir güvenlik sınıflandırıcısı olan Shieldstral 1.0 3B'yi yayınladı. Bu model, içerik denetimini sabit bir zarar kategorileri taksonomisi yerine tek bir evet/hayır sorusu olarak ele alıyor. Zarar kategorilerini ağırlıklarına gömen çoğu koruma modelinin aksine, Shieldstral, operatörlerin politikayı çıkarım sırasında düz bir dille soru olarak yazmasına olanak tanıyor ve tek bir ileri geçişten kalibre edilmiş bir güvenlik puanı döndürüyor. Ministral-3-3B-Base-2512 üzerine inşa edilen ve yerel bir Pixtral görüntü kodlayıcıya sahip olan model, Apache 2.0 lisansıyla yayınlandı. Metin güvenliğinde ortalama %84,9 F1 puanı bildiriyor ve bu, GPT-OSS-Safeguard-20B ile eşleşiyor; çok modlu güvenlikte ise %83,8 ile Mistral'ın değerlendirdiği tüm temel modellerin önünde yer alıyor. Model, BF16'da 16GB VRAM'e sığıyor, tek bir GPU üzerinde çalışıyor ve vLLM, llama.cpp, SGLang ve Transformers'ı destekliyor. Eğitim verileri yaklaşık 54,1 milyon örnek içeriyor ve zıt üretim, politikaya özgü ihlalleri öğretmek için zorlu negatif örnekler oluşturuyor. Zayıf yönler arasında Arapça ve Endonezce gibi düşük kaynaklı dillerde daha düşük performans ile çekişmeli veya gizlenmiş girdiler ve çok uzun belgeler üzerinde azalan güvenilirlik yer alıyor.
Kaynak: MarkTechPost —
orijinal
