大型语言模型幻觉:AI模型如何虚构不存在的软件包
OpenAI
Meta
DeepSeek
Mistral
一项新研究揭示,大型语言模型经常虚构软件包名称,带来供应链攻击风险。研究人员测试了16个模型,生成了57.6万个代码样本,发现平均19.7%的软件包推荐是虚构的。他们还提出了缓解策略。
这项名为‘我们为您提供软件包!’的研究分析了代码生成大语言模型产生的软件包幻觉。研究人员测试了16个模型,包括GPT-3.5、GPT-4、GPT-4 Turbo、CodeLlama、DeepSeek Coder等,为Python和JavaScript生成了576,000个代码样本。他们发现440,445条推荐(即19.7%)属于幻觉,商业模型的幻觉率至少为5.2%,而开放模型则达到21.7%。模型在近期主题上更容易产生幻觉,降低温度会减少风险,但无法完全消除。研究还发现,模型经常重复自己的幻觉,并且大多数幻觉名称并非真实软件包的简单拼写错误。该研究在USENIX Security 2025上获得了杰出论文奖。
来源: Habr — хаб ИИ —
原文
