Temel Kusur, LLM'leri Saldırılara Karşı Savunmasız Bırakıyor
OpenAI
Anthropic
Alibaba/Qwen
DeepSeek
Araştırmacılar, büyük dil modellerinin (LLM'ler, large language models) onları saldırılara karşı oldukça savunmasız kılan temel bir kusura sahip olduğunu savunuyor. Saldırganlar, LLM'lerin talimat kaynaklarını nasıl tanımladığını istismar ederek, ilaç sentezi veya uçak sabotaj talimatları gibi yasaklanmış bilgileri ifşa etmeleri için onları kandırabiliyor.
Uluslararası Makine Öğrenimi Konferansı'nda bağımsız araştırmacılar Charles Ye ve Jasmine Cui tarafından sunulan bir makale, büyük dil modellerinde (LLM'ler) onları saldırılara karşı savunmasız bırakan temel bir kusuru ortaya koyuyor. Kusur, LLM'lerin kendilerine talimat veren kişi veya şeyi nasıl tanımladığıyla ilgili; bu da onları kokain sentezleme talimatı vermek veya bir uçağın navigasyon sistemini sabote etmek gibi yapmamaları gereken şeyleri yapmaya kandırmayı kolaylaştırıyor. Araştırmacılar, LLM'lerin metnin rolünü etiketlerle değil, stil ile tanımladığını ve saldırganların bu sayede rolleri taklit edebildiğini buldu. OpenAI, Anthropic, Alibaba ve DeepSeek'ten modellerde zincirleme düşünce sahteciliği saldırıları gerçekleştirdiler. Araştırmacılar, bu sorunun temelde çözülemez olduğunu, çünkü hiçbir eğitimin bunu tamamen gideremeyeceğini savunuyor. LLM'lerin yeterli temel çalışma yapılmadan kritik sistemlerde kullanıldığı konusunda uyarıyorlar.
Kaynak: MIT Technology Review —
orijinal
