StruQ dan SecAlign: Mempertahankan Diri dari Serangan Injeksi Prompt
Meta
OpenAI
Peneliti dari BAIR mengusulkan dua pertahanan fine-tuning, StruQ dan SecAlign, terhadap serangan injeksi prompt pada aplikasi yang terintegrasi dengan LLM. StruQ menggunakan penyesuaian instruksi terstruktur untuk mengabaikan instruksi yang disuntikkan, sementara SecAlign menerapkan optimasi preferensi untuk mencapai ketahanan yang lebih baik, mengurangi tingkat keberhasilan serangan hingga mendekati 0% untuk serangan tanpa optimasi dan di bawah 15% untuk serangan berbasis optimasi.
Prompt injection, di mana data yang tidak tepercaya berisi instruksi yang menimpa prompt yang dimaksudkan oleh sistem, terdaftar sebagai ancaman nomor satu oleh OWASP untuk aplikasi yang terintegrasi dengan LLM. Sistem tingkat produksi seperti Google Docs, Slack AI, dan ChatGPT telah terbukti rentan. Para penulis mengusulkan dua penyebab: kurangnya pemisahan antara prompt dan data, serta LLM yang dilatih untuk mengikuti instruksi di mana pun dalam input. Untuk mengatasinya, mereka memperkenalkan Secure Front-End yang menggunakan token khusus untuk membatasi prompt dan data, menyaring pembatas apa pun dalam data. StruQ (Structured Instruction Tuning) mensimulasikan prompt injection selama pelatihan, mengajarkan LLM untuk mengabaikan instruksi yang diinjeksikan di bagian data. SecAlign (Special Preference Optimization) melangkah lebih jauh dengan melatih respons yang diinginkan dan tidak diinginkan, menggunakan optimasi preferensi untuk menciptakan kesenjangan probabilitas yang besar di antara keduanya. Eksperimen pada Llama3-8B-Instruct menunjukkan bahwa StruQ mengurangi Tingkat Keberhasilan Serangan (ASR) menjadi 45%, dan SecAlign menguranginya lebih lanjut menjadi 8% terhadap serangan canggih. SecAlign mempertahankan utilitas seperti yang diukur oleh AlpacaEval2, sementara StruQ menurunkannya sebesar 4,5%. Keduanya mengurangi tingkat keberhasilan serangan tanpa optimasi hingga hampir 0%, dan SecAlign mengurangi ASR serangan berbasis optimasi dengan faktor lebih dari 4 dibandingkan dengan state-of-the-art sebelumnya.
Sumber: BAIR (Berkeley AI) —
asli
