StruQ und SecAlign: Schutz vor Prompt-Injection-Angriffen
Meta
OpenAI
Forscher von BAIR schlagen zwei Feintuning-Verteidigungen, StruQ und SecAlign, gegen Prompt-Injection-Angriffe in LLM-integrierten Anwendungen vor. StruQ verwendet strukturiertes Instruction Tuning, um injizierte Anweisungen zu ignorieren, während SecAlign Präferenzoptimierung anwendet, um eine bessere Robustheit zu erreichen. Beide Methoden senken die Angriffserfolgsrate auf nahezu 0% für optimierungsfreie Angriffe und unter 15% für optimierungsbasierte Angriffe.
Prompt-Injection, bei der nicht vertrauenswürdige Daten eine Anweisung enthalten, die das beabsichtigte Prompt des Systems überschreibt, wird von OWASP als die größte Bedrohung für LLM-integrierte Anwendungen eingestuft. Es hat sich gezeigt, dass produktionsreife Systeme wie Google Docs, Slack AI und ChatGPT anfällig sind. Die Autoren schlagen zwei Ursachen vor: das Fehlen einer Trennung zwischen Prompt und Daten sowie die Tatsache, dass LLMs darauf trainiert sind, Anweisungen an jeder beliebigen Stelle der Eingabe zu befolgen. Um diese Probleme zu adressieren, führen sie ein sicheres Front-End ein, das spezielle Token zur Abgrenzung von Prompt und Daten verwendet und alle Trennzeichen in den Daten herausfiltert. StruQ (Structured Instruction Tuning) simuliert Prompt-Injection während des Trainings und lehrt das LLM, injizierte Anweisungen im Datenteil zu ignorieren. SecAlign (Special Preference Optimization) geht noch einen Schritt weiter, indem es sowohl auf wünschenswerte als auch auf unerwünschte Antworten trainiert und mithilfe von Präferenzoptimierung eine große Wahrscheinlichkeitslücke zwischen diesen schafft. Experimente mit Llama3-8B-Instruct zeigen, dass StruQ die Angriffs-Erfolgsrate (Attack Success Rate, ASR) auf 45 % senkt und SecAlign sie bei anspruchsvollen Angriffen weiter auf 8 % reduziert. SecAlign erhält die Nützlichkeit, gemessen an AlpacaEval2, während StruQ sie um 4,5 % verringert. Beide reduzieren optimierungsfreie Angriffs-Erfolgsraten auf nahezu 0 %, und SecAlign reduziert die ASR optimierungsbasierter Angriffe um mehr als das Vierfache im Vergleich zum vorherigen Stand der Technik.
Quelle: BAIR (Berkeley AI) —
Original
