StruQ und SecAlign: Schutz vor Prompt-Injection-Angriffen
Forscher von BAIR schlagen zwei Feintuning-Verteidigungen, StruQ und SecAlign, gegen Prompt-Injection-Angriffe in LLM-integrierten Anwendungen vor. StruQ verwendet strukturiertes Instruction Tuning, um injizierte Anweisungen zu ignorieren, während SecAlign Präferenzoptimierung anwendet, um eine bessere Robustheit zu erreichen. Beide Methoden senken die Angriffserfolgsrate auf nahezu 0% für optimierungsfreie Angriffe und unter 15% für optimierungsbasierte Angriffe.
Meta
OpenAI

