Rus Büyük Dil Modelleri OWASP LLM10: Sınırsız Tüketim Saldırılarına Karşı Test Edildi
Яндекс
Сбер
AI Red Team projesindeki araştırmacılar, Rus amiral gemisi modelleri YandexGPT Lite 5 ve GigaChat Lite'ı OWASP LLM10: Sınırsız Tüketim saldırılarına karşı test etti. Hesaplama yükünü artırmak için özel olarak hazırlanmış istemler kullanarak özyinelemeli bağlam genişletme, fraktal iç içe geçme, kombinatoryal patlama ve çok etmenli simülasyonlar tetiklediler. Çalışma, geleneksel savunmaların bu tür kaynak tükenmesi saldırılarına karşı yetersiz olduğunu vurguluyor.
Makale, OWASP LLM10: Sınırsız Tüketim kategorisini ele almaktadır; bu kategori, dil modellerini orantısız derecede büyük miktarda hesaplama yapmaya zorlayarak kaynak tükenmesine ve hizmet reddine yol açan saldırılara odaklanır. Araştırmacılar, özyinelemeli bağlam genişletme (Quine benzeri özyineleme), fraktal iç içe geçme, hesaplama patlaması, anlamsal kombinatoryal patlama, çoklu ajan simülasyonu ve glitch token istismarı dahil olmak üzere çeşitli saldırı sınıflarını temsil eden kötü niyetli istemler hazırladılar. Bu istemler, modellerin aşırı uzun yanıtlar üretmesine, binlerce varlığı simüle etmesine veya kendi muhakemelerini özyinelemeli olarak analiz etmesine neden olabilir ve tüm bunlar meşru kullanıcı istekleri gibi görünür. Çalışma, 2000'den fazla kötü niyetli istemi destekleyen ve bunların 200'ü OWASP LLM10'u hedef alan AI Red Team web servisini kullanarak iki Rus amiral gemisi LLM'sini, YandexGPT Lite 5 ve GigaChat Lite'ı test etti. Değerlendirme, manuel doğrulama ile LLM-as-judge (yargıç olarak dil modeli) içeriyordu. Makale, anahtar kelime filtreleme gibi geleneksel güvenlik önlemlerinin etkisiz olduğunu vurguluyor ve daha sağlam mimari savunmalara olan ihtiyacı öne çıkarıyor.
Kaynak: Habr — хаб ИИ —
orijinal
