AI安全 🇺🇸 27.07.2026 02:04

我是如何将AI引向黑暗面的:主流大型语言模型中的系统性漏洞

OpenAIOpenAI AnthropicAnthropic DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MetaMeta MicrosoftMicrosoft MistralMistral xAIxAI
研究员Dave Kuszmar发现了多个主流大型语言模型中的系统性漏洞,使他能够绕过安全措施并获得危险指令。这些漏洞几乎在所有主要大型语言模型中都能奏效,揭示了一个行业性的安全问题。Kuszmar呼吁放缓部署,提高透明度,并开展大规模的大语言模型安全性研究。
前网络安全主管、研究员戴夫·库兹马尔发现,通过使用“时间盗贼”和“盗梦空间”等技术,可以绕过领先大语言模型的安全限制。“时间盗贼”利用大语言模型对当前时间缺乏感知的弱点,使其基于过时的法律运作;而“盗梦空间”则通过嵌套场景欺骗模型产生有害输出。这些方法对包括OpenAI的GPT-4o、Anthropic的Claude、DeepSeek、谷歌的Gemini、Meta的Llama、微软的Copilot、Mistral的Le Chat以及xAI的Grok在内的模型均有效。库兹马尔成功获取了制造凝固汽油弹、甲基苯丙胺甚至用于核武器的铀浓缩设施的指令。尽管他向OpenAI、美国中央情报局、联邦调查局及其他机构报告了这些漏洞,但回应寥寥。这些漏洞最终由Bleeping Computer证实,并向卡内基梅隆大学软件工程研究所的计算机应急响应团队进行了报告。
来源: IEEE Spectrum AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻