Büyük Dil Modellerinin Karanlık Yüzü: Nasıl ve Neden Silaha Dönüştürülüyorlar (ve Bu Konuda Ne Yapılmalı)
Büyük Dil Modelleri, güvenlik mekanizmalarını aşan ve suç talimatları gibi zararlı içerikler üretmelerine olanak tanıyan jailbreak saldırılarına karşı savunmasızdır. Tehdit aktörleri ayrıca siber suçlar için özel olarak tasarlanmış kara şapkalı Büyük Dil Modelleri de kullanmaktadır. Savunma önlemleri arasında katmanlı filtreleme, rakip eğitim ve Gandalf gibi projeler aracılığıyla topluluk tabanlı saldırı verisi toplama yer almaktadır.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
