Mistral, güvenlik sınıflandırmaları için yeni teknik içeren model yayınladı
Mistral
Mistral AI, yapay zeka tarafından üretilen içerikleri denetlemek için esnek bir soru-cevap yaklaşımı kullanan bir güvenlik modeli olan Shieldstral'ı tanıttı. Sabit kategoriler yerine, operatörler denetim politikalarını doğal dilde evet/hayır soruları olarak tanımlıyor ve Shieldstral bir güvenlik puanı döndürüyor. Model, yedi kat daha büyük modellere benzer performans elde ederken 16 GB'lık bir Nvidia GPU üzerinde çalışıyor.
Mistral AI, yapay zeka tarafından üretilen içeriklerin moderasyonunu basitleştirmek için tasarlanmış bir güvenlik modeli olan Shieldstral'ı tanıttı. Sabit kategoriler yerine esnek bir soru-cevap yaklaşımı kullanıyor: operatörler, moderasyon politikalarını 'Bu içerik gerçek şiddet çağrısı yapıyor mu?' gibi doğal dilde evet/hayır soruları olarak formüle ediyor ve Shieldstral, istemin veya yapay zeka yanıtının onaylanıp onaylanmayacağına göre bir güvenlik puanı döndürüyor. Mistral'e göre bu yöntemin iki avantajı var: birincisi, operatörler içerikle ilgili sorulan soruları istedikleri zaman kolayca ayarlayabilir; ikincisi, içeriğin bağlamını daha iyi değerlendirebilir. Örneğin, bir okul dersinde toplama kampları hakkında yapılan çağdaş konuşmalardan gerekli doğrudan alıntılar olabilecek şey, kişisel bir blog yazısı için içerik olarak son derece eleştirel olabilir. İlgili makalenin yazarları, sabit taksonomilere sahip önceki emniyet modellerinin, izin verilebilirliğin genellikle kategorilere bağlı olması nedeniyle bu tür bağlamsal farklılıkları yeterince yakalayamadığını savunuyor. Girdi, moderasyonu ikili bir soru-cevap görevi olarak ele alır: model, bir sistem talimatı, bağlam ve evet/hayır sorusu alır ve çıkarım sırasında yalnızca evet ve hayır logitlerini çıkarır ve bunları softmax ile sürekli bir güvenlik puanına normalleştirir. Mistral, Shieldstral'ın yedi kat daha büyük modellerle aynı performansı elde ettiğini ancak 16 GB Nvidia GPU üzerinde çalıştığını iddia ediyor. Teknik olarak Shieldstral, Mistral'in kendi ailesinden, yakın zamanda matematiksel kanıtlar ve biçimsel doğrulama için optimize edilmiş Leanstral 1.5 ile genişletilen nedensel bir dil modeli olan Ministral-3B-Base-2512'ye dayanıyor. Görüntü işleme için bir Pixtral-Vision-Encoder kullanılıyor. 3 milyar parametreli model, Hugging Face'te Apache-2.0 lisansı altında Açık Ağırlıklar olarak indirilebilir.
Kaynak: Heise online —
orijinal
