提示注入并非通过过滤器解决:如何利用架构模式隔离不可信文本
OpenAI
Anthropic
Google DeepMind
Microsoft
提示注入仍然是大型语言模型应用中的结构漏洞,无法通过系统提示或分类器修复。Dual-LLM、谷歌DeepMind的CaMeL以及Meta的智能体双重规则等架构模式提供了稳健的隔离方案。文章详细阐述了威胁模型、微软365 Copilot中的EchoLeak漏洞,以及一个包含三个隔离模型的具体实现。
提示注入(Prompt injection)由西蒙·威尔逊(Simon Willison)于2022年9月提出,指大语言模型(LLM)上下文中不可信的文本被当作指令执行。与越狱攻击不同,它影响的是模型能访问工具和数据的应用场景,导致“混淆代理”攻击和数据泄露。文章指出,系统提示和防护分类器效果甚微,引用OpenAI、Anthropic和谷歌DeepMind在2025年的一项研究:自适应攻击可绕过12种已公开的防御手段,成功率超过90%。西蒙·威尔逊的“致命三要素”定义了数据泄露的三个条件:访问私有数据、接触不可信内容、存在外发通道。微软365 Copilot中的EchoLeak漏洞(CVE-2025-32711)兼具这三要素。Meta的“代理二选一规则”指出,一个代理不应同时具备以下三个属性中的两个以上:处理不可信输入、访问敏感系统或数据、改变状态或对外通信的能力。类似双LLM(Dual-LLM,威尔逊,2023年)的架构将一个特权LLM(拥有工具、仅处理可信输入)与一个隔离LLM(无工具、处理不可信文本)分开,两者之间由确定性控制器连接。谷歌DeepMind的CaMeL(2024年)使用验证器确保隔离模型只输出严格允许的令牌子集。2025年一篇论文提出了六种项目模式来扩展这一思路。文章还描述了一个具体的实现方案,用于FAQ生成器,涉及三个独立模型:一个特权模型(可访问公司数据和工具)、一个隔离模型(处理不可信的页面文本)、一个用于合成的模型,模型之间执行确定性检查。
来源: Habr — хаб ИИ —
原文
