LLM安全研究:研究人员可从聊天机器人回复中重建用户提示词
Alibaba/Qwen
OpenAI
来自印度理工学院孟买分校和Adobe Research的研究人员开发了一种方法,能够从大型语言模型的文本输出中高精度地重建其原始提示词。该方法无需访问模型权重,甚至适用于其他供应商的模型。这对使用专有系统提示词的企业构成了潜在的安全风险。
来自印度理工学院孟买分校和Adobe研究院的研究人员开发出一种方法,能够从大语言模型的文本输出中几乎精确地重建其输入提示词,且无需访问模型权重,甚至还能迁移到其他模型上。该方法被称为“前词预测”(PTP),它通过训练一个逆模型来预测前一个词而非下一个词,从而逆转了语言模型的基本原理。这个逆模型仅使用目标大语言模型生成的合成数据从头开始训练。逆模型不仅能精确恢复原始提示词,还能通过改变解码参数生成多个语义不同的提示词变体。论文中的一个定性示例显示,提示词“如何联系竞争对手以了解他们的定价策略?”被精确重建,同时还生成了六个其他变体。使用真实用户提示词的测试也显示出了语义上的忠实重建。一个在Qwen-3-0.6B-Chat上训练的小型逆模型还能从GPT-4o的响应中重建提示词,捕捉到潜在的上下文和意图,这意味着攻击者甚至不需要知道文本输出背后是哪个模型。这给企业带来了广泛的安全问题,因为包含商业机密、审核规则或专门指令的专有系统提示词可能被提取,同时机密用户输入也可能被泄露。论文本身并未明确对商业系统的攻击发表声明,但模型制造商需要澄清并可能修复这一漏洞。
来源: The Decoder (DE) —
原文
