AI-veiligheidOnderzoek 🇺🇸 27.07.2026 17:06

StruQ en SecAlign: verdediging tegen prompt injectie aanvallen

MetaMeta OpenAIOpenAI
Onderzoekers van BAIR stellen twee fine-tuning verdedigingen voor, StruQ en SecAlign, tegen prompt injectie aanvallen in LLM-geïntegreerde toepassingen. StruQ gebruikt gestructureerde instructie afstemming om geïnjecteerde instructies te negeren, terwijl SecAlign voorkeursoptimalisatie toepast om betere robuustheid te bereiken, waardoor aanvalspercentages tot bijna 0% voor optimalisatievrije aanvallen en onder 15% voor optimalisatiegebaseerde aanvallen worden verlaagd.
Promptinjectie, waarbij onvertrouwde gegevens een instructie bevatten die de bedoelde prompt van het systeem overschrijft, wordt door OWASP genoemd als de nummer 1 bedreiging voor LLM-geïntegreerde applicaties. Productiesystemen zoals Google Docs, Slack AI en ChatGPT zijn kwetsbaar gebleken. De auteurs stellen twee oorzaken voor: het gebrek aan scheiding tussen prompt en gegevens, en het feit dat LLM's zijn getraind om instructies overal in de invoer te volgen. Om deze problemen aan te pakken introduceren ze een Secure Front-End dat speciale tokens gebruikt om prompt en gegevens te scheiden, waarbij elk scheidingsteken in de gegevens wordt gefilterd. StruQ (Structured Instruction Tuning, gestructureerde instructie-afstemming) simuleert promptinjecties tijdens de training, waardoor de LLM wordt geleerd om geïnjecteerde instructies in het datagedeelte te negeren. SecAlign (Special Preference Optimization, speciale preferentie-optimalisatie) gaat verder door te trainen op zowel wenselijke als onwenselijke antwoorden, waarbij preferentie-optimalisatie wordt gebruikt om een groot waarschijnlijkheidsverschil tussen beide te creëren. Experimenten op Llama3-8B-Instruct tonen aan dat StruQ het aanvalssuccespercentage (Attack Success Rate, ASR) verlaagt tot 45%, en SecAlign verlaagt het verder tot 8% tegen geavanceerde aanvallen. SecAlign behoudt de bruikbaarheid zoals gemeten door AlpacaEval2, terwijl StruQ deze met 4,5% vermindert. Beide verlagen de slagingspercentages van optimalisatievrije aanvallen tot bijna 0%, en SecAlign vermindert de ASR van optimalisatiegebaseerde aanvallen met een factor van meer dan 4 in vergelijking met de vorige state-of-the-art.
Bron: BAIR (Berkeley AI) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws