Prompt-Injection kann nicht durch Filter geheilt werden: Wie man unzuverlässigen Text mit Architekturmustern isoliert
Prompt-Injection ist ein struktureller Defekt in großen Sprachmodellen, bei dem unzuverlässiger Text als Anweisung ausgeführt wird. Filter und System-Prompts sind wirkungslos: Selbst die besten Abwehrmechanismen werden bei adaptiven Angriffen in 90% der Fälle durchbrochen. Erfolgreiche Ansätze – Dual-LLM, CaMeL und die Two-Meta-Regel – setzen auf Isolation, anstatt zwischen Gut und Böse unterscheiden zu wollen.
OpenAI
Anthropic
Google DeepMind
Microsoft
Habr — хаб ИИ24.07 · 11:01
