AI安全 🇺🇸 30.07.2026 14:03

根本缺陷使大型语言模型易受攻击

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
研究人员认为,大型语言模型存在一个根本性缺陷,使其极易受到黑客攻击。通过利用LLM识别指令来源的方式,攻击者可以诱骗其泄露违禁信息,例如药物合成或飞机破坏指令。
独立研究员查尔斯·叶和茉莉花·崔在国际机器学习会议上发表的一篇论文揭示了大型语言模型的一个根本性缺陷,使其容易受到攻击。该缺陷涉及LLM如何识别指令的发出者或来源,使得攻击者能够轻易诱骗它们执行本不应做的事情,例如提供合成可卡因的说明或破坏飞机导航系统。研究人员发现,LLM并非通过标签来判断文本的角色,而是通过风格,这使得攻击者可以伪造角色。他们对OpenAI、Anthropic、阿里巴巴和DeepSeek的模型展示了思维链伪造攻击。研究人员认为,这个问题从根本上无法解决,因为再多的训练也无法完全解决。他们警告说,LLM正被部署在关键系统中,但缺乏足够的基础研究。
来源: MIT Technology Review — 原文
我们之前关于此话题的帖子 ↓
最新新闻