提示注入无法通过过滤器解决:如何利用架构模式隔离不可信文本
提示注入是大语言模型的结构性缺陷,其中不可信文本被当作指令执行。过滤器和系统提示无效:即使在自适应攻击下,最佳防御也在90%的案例中被攻破。可行的方案——双大语言模型、CaMeL和Two Meta规则——构建隔离而非试图区分善恶。
OpenAI
Anthropic
Google DeepMind
Microsoft
Habr — хаб ИИ24.07 · 11:01
