Forschung RSS

KI-Sicherheit 🇷🇺

Prompt-Injection kann nicht durch Filter geheilt werden: Wie man unzuverlässigen Text mit Architekturmustern isoliert

Prompt-Injection ist ein struktureller Defekt in großen Sprachmodellen, bei dem unzuverlässiger Text als Anweisung ausgeführt wird. Filter und System-Prompts sind wirkungslos: Selbst die besten Abwehrmechanismen werden bei adaptiven Angriffen in 90% der Fälle durchbrochen. Erfolgreiche Ansätze – Dual-LLM, CaMeL und die Two-Meta-Regel – setzen auf Isolation, anstatt zwischen Gut und Böse unterscheiden zu wollen.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Aktuelle Nachrichten