StruQ ve SecAlign: Prompt Enjeksiyon Saldırılarına Karşı Savunma
Meta
OpenAI
BAIR'deki araştırmacılar, LLM ile entegre uygulamalarda prompt enjeksiyon saldırılarına karşı iki ince ayar savunması öneriyor: StruQ ve SecAlign. StruQ, enjekte edilen talimatları görmezden gelmek için yapılandırılmış talimat ayarı kullanırken, SecAlign daha iyi sağlamlık için tercih optimizasyonu uygulayarak optimizasyon gerektirmeyen saldırılarda başarı oranını neredeyse %0'a, optimizasyon tabanlı saldırılarda ise %15'in altına düşürüyor.
Prompt enjeksiyonu, güvenilir olmayan verilerin sistemin amaçlanan istemini geçersiz kılan bir talimat içermesi durumudur ve LLM ile entegre uygulamalar için OWASP tarafından bir numaralı tehdit olarak listelenmiştir. Google Docs, Slack AI ve ChatGPT gibi üretim düzeyindeki sistemlerin savunmasız olduğu gösterilmiştir. Yazarlar iki neden öne sürmektedir: istem ve veri arasında ayrım eksikliği ve LLM'lerin girdinin herhangi bir yerindeki talimatları takip etmek üzere eğitilmiş olması. Bunları ele almak için, istem ve veriyi ayırmak için özel belirteçler kullanan ve verideki herhangi bir sınırlayıcıyı filtreleyen Güvenli Bir Ön Uç (Secure Front-End) tanıtıyorlar. StruQ (Yapılandırılmış Talimat İnce Ayarı), eğitim sırasında prompt enjeksiyonlarını simüle ederek LLM'ye veri kısmındaki enjekte edilmiş talimatları yok saymayı öğretir. SecAlign (Özel Tercih Optimizasyonu), hem istenen hem de istenmeyen yanıtlar üzerinde eğitim yaparak ve tercih optimizasyonu kullanarak aralarında büyük bir olasılık farkı oluşturarak daha da ileri gider. Llama3-8B-Instruct üzerinde yapılan deneyler, StruQ'nun Saldırı Başarı Oranını (Attack Success Rate - ASR) %45'e düşürdüğünü ve SecAlign'in sofistike saldırılara karşı bu oranı %8'e daha da indirdiğini göstermektedir. SecAlign, AlpacaEval2 ile ölçüldüğü üzere kullanışlılığı korurken, StruQ bunu %4,5 azaltmaktadır. Her ikisi de optimizasyon içermeyen saldırı başarı oranlarını neredeyse %0'a düşürmekte ve SecAlign, optimizasyon tabanlı saldırı ASR'sini önceki en iyi teknolojiye kıyasla 4 kattan fazla azaltmaktadır.
Kaynak: BAIR (Berkeley AI) —
orijinal
