Büyük Dil Modellerinin Karanlık Yüzü: Nasıl ve Neden Silaha Dönüştürülüyorlar (ve Bu Konuda Ne Yapılmalı)
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Büyük Dil Modelleri, güvenlik mekanizmalarını aşan ve suç talimatları gibi zararlı içerikler üretmelerine olanak tanıyan jailbreak saldırılarına karşı savunmasızdır. Tehdit aktörleri ayrıca siber suçlar için özel olarak tasarlanmış kara şapkalı Büyük Dil Modelleri de kullanmaktadır. Savunma önlemleri arasında katmanlı filtreleme, rakip eğitim ve Gandalf gibi projeler aracılığıyla topluluk tabanlı saldırı verisi toplama yer almaktadır.
Jailbreak, bir saldırganın LLM'e güvenlik eğitimini geçersiz kılan bir rol atadığı bir tür komut enjeksiyonudur. Örneğin, forumlarda paylaşılan SWILL adlı bir komut, DeepSeek'in sansürsüz farklı bir model olduğuna inanmasını sağladı ve ardından parmak izlerini yok etme ve sahte para basma konusunda isteyerek tavsiyelerde bulundu; ancak Tiananmen Meydanı olayını tartışmayı yine de reddetti. Jailbreak'ler işe yarar çünkü LLM güvenliği ayrı bir modül değil, modelin öğrenilmiş davranışının bir parçasıdır; bir jailbreak, olasılık dağılımını zararlı çıktılara doğru kaydıran güçlü bir bağlamsal sinyal oluşturur. Jailbreak'lerin ötesinde, WormGPT, EvilGPT, WolfGPT ve DarkBERT gibi özel kara şapka LLM'leri özellikle siber suç için eğitilmiştir; ancak çoğu artık işlevini yitirmiş veya dolandırıcılıktır. Savunmalar arasında sistem ve kullanıcı komutlarının mimari olarak ayrılması, AVI (Hizalanmış/Anlaşma Doğrulama Arayüzü) veya Llama Guard gibi giriş/çıkış filtreleri, çekişmeli ince ayar, anayasal yapay zeka hizalama, iç aktivasyon analizi, RAG tabanlı koruma ve kırmızı takım çalışması yer alır. Jailbreak teknikleri hakkında gerçek zamanlı veri toplamak için Lakera, katılımcıların gizli bilgileri sızdırmak veya zararlı davranışa zorlamak için simüle edilmiş yapay zeka uygulamalarını hacklediği interaktif bir oyun olan Gandalf projesini başlattı; katılımı artırmak için bir liderlik tablosu bulunuyor.
Kaynak: Habr — хаб ИИ —
orijinal
