Yapay zeka hizmetlerinde prompt moderasyonu nasıl çalışır: iyi, kötü, engellenmiş
OpenAI
Anthropic
xAI
Google/DeepMind
Яндекс
Yapay zeka hizmetlerinde hassas promptların moderasyonu birden fazla aşamayı içerir: ürün politikaları, girdi sınıflandırıcıları ve çıktı filtreleri. Aynı talep, farklı modeller tarafından farklı şekilde ele alınabilir; bazıları engeller, bazıları uyarır, bazıları yerine getirir. Makale, sınırda erotik bir prompt üzerinde GPT-5.5 Instant, Claude Sonnet 5 ve Grok yanıtlarını karşılaştırmakta ve sınıflandırıcı eşikleri, büyük dil modeli tabanlı filtreler ve bağlamın önemi gibi moderasyon tekniklerini açıklamaktadır.
Yapay zeka hizmetlerinde içerik denetimi, ürün politikaları, giriş sınıflandırıcıları ve çıktı filtrelerinden oluşan bir sistem kullanır. Farklı modeller aynı hassas isteme farklı tepki verir: biri reddedebilir, diğeri sorgulanabilir ayrıntılara işaret edebilir, üçüncüsü ise uyabilir. Makale, bir çizgi roman sahnesi için sınırda erotik bir istekle GPT-5.5 Instant (ChatGPT), Claude Sonnet 5 ve Grok'u test etti. Yalnızca bir model metni yazmayı kabul etti. Denetim, tehditler, nefret, şiddet, kendine zarar verme, cinsel içerik, çocuk istismarı ve silahlar gibi kategorileri tanımlayan ürün politikalarına dayanır. Giriş sınıflandırıcısı kategori puanları atar; örneğin, OpenAI'in Denetim API'si (Moderation API) alt kategorilerle birlikte 13 etiket döndürür. Sınıflandırıcı, yanlış pozitifler ('can sıkıntısı nasıl öldürülür' gibi zararsız sorguları engellemek) veya yanlış negatifler (zararlı içeriği kaçırmak) üretebilir. Şirketler kategori başına eşikler belirler: kendine zarar verme için yüksek duyarlılık önceliklendirilir; daha az tehlikeli kategoriler için kesinlik daha önemli olabilir. Denetim, küçük bir büyük dil modeli (isteme dayalı) veya özel bir sınıflandırıcı ile uygulanabilir. Büyük dil modeli denetleyicileri esnektir ancak maliyetlidir ve istem enjeksiyonuna yatkındır; özel sınıflandırıcılar daha hızlıdır ancak katıdır. En iyi uygulama, birden fazla doğrulama seviyesi, argo ve yazım hataları içeren bir test seti hazırlama, kategori başına eşikleri yapılandırma, uzun diyalogları inceleme, yapılandırmaları sürümleme ve manuel inceleme için kararları günlüğe kaydetmeyi içerir.
Kaynak: Habr — хаб ИИ —
orijinal
