AI安全 🇷🇺 29.07.2026 02:01

提示注入并非攻击,而是大语言模型助手的特性

OpenAIOpenAI AnthropicAnthropic
文章认为提示注入并非安全漏洞,而是基于大语言模型的AI助手遵循指令的正常行为。作者通过实验证明,许多AI服务将上传文件或翻译任务中的文本视为指令,并提出了缓解策略。
作者解释说,提示注入本质上是AI助手执行嵌入在用户提供的数据中的指令,类似于一位尽职尽责的员工。在一项实验中,9个AI服务收到一个文本文件,其中包含一条指令:用罗马数字格式化列表,并在所有未来回复中添加一条永久引用。两个服务完全忽略了指令,五个格式化了列表但未更改账户设置,而两个服务执行了全部两条指令。作者指出,即使是翻译任务,也有8个服务将其视为指令,其中有一个还更新了其账户记忆。问题在于大语言模型无法区分数据和指令。作为部分补救措施,作者建议明确指示AI将所有输入视为数据而非命令,并指出ChatGPT和Claude已经内置了对来自文件的提示注入的抵抗能力。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻