Mistral, yapay zeka tarafından üretilen içeriği kontrol etmek için açık model tanıttı
Mistral
Mistral, riskli içeriği tespit etmek ve yönetişim politikalarını uygulamak için tasarlanmış, 3 milyar parametreli açık ağırlıklı çok modlu bir güvenlik modeli olan Shieldstral'ı piyasaya sürdü. Model, 16 GB belleğe sahip tek bir Nvidia GPU üzerinde çalışıyor ve Apache 2.0 lisansı altında yayınlandı. Geliştiriciler, doğal dil soruları kullanarak kontrol kuralları tanımlayabilirler.
Kurumsal ortamlarda üretken yapay zeka asistanlarının kullanımının artmasıyla birlikte içerik kontrolü merkezi bir konu haline geliyor. Bu sorunu ele almak için Mistral, riskli içerikleri tespit etmek ve uygun yönetişim politikalarını uygulamak üzere tasarlanmış, 3 milyar parametreli açık ağırlıklı çok modlu bir güvenlik modeli olan Shieldstral'ı piyasaya sürdü. Model 12 dili desteklemektedir. Apache 2.0 lisansı altında yayınlanan model, ağırlıklarını geliştiricilerin kullanımına sunarak kolay entegrasyon ve uyarlama sağlar ve 16 GB video belleğine sahip tek bir Nvidia GPU'sunda çalışabilir. Shieldstral, Hugging Face üzerinden indirilebilir. Şiddet, nefret söylemi, dolandırıcılık veya açık cinsel içerik gibi önceden tanımlanmış kategoriler üzerinde eğitilmiş geleneksel filtreleme sistemlerinden farklı olarak Shieldstral, geliştiricilerin kontrol kurallarını doğal dil soruları olarak tanımlayabildiği yapılandırılabilir bir yaklaşım kullanır; örneğin, "Bu içerik fiziksel şiddeti teşvik ediyor mu?" İstek, analiz bağlamını, beklenen ciddiyeti veya içeriğin doğasını (metin veya görüntü) belirten talimatlarla desteklenebilir. Model, 'evet' ve 'hayır' yanıtlarının olasılıklarına dayalı olarak nihai karar için yalnızca bir jeton üreten ikili bir güvenlik değerlendirmesi sağlar. Kullanıcı isteğini üretken bir modele göndermeden önce veya bir yanıtı yayınlamadan önce kontrol etmek için üretim sonrasında olmak üzere yapay zeka işleme sürecinin farklı aşamalarında kullanılabilir. Mistral'e göre Shieldstral, özellikle metin güvenliği, reddetme tespiti ve çok modlu değerlendirmede olmak üzere birçok ölçütte kendisinden yedi kata kadar daha büyük açık koruma modellerinden eşit veya daha iyi performans gösterir ve metin güvenliği değerlendirmelerinde ortalama %84,9, görüntü analizi de dahil olmak üzere çok modlu güvenlik testlerinde %83,8'lik bir genel ortalama puan elde eder.
Kaynak: Le Monde Informatique — IA —
orijinal
