LLMの幻覚:AIモデルが存在しないパッケージをでっち上げる仕組み
OpenAI
Meta
DeepSeek
Mistral
新しい研究により、大規模言語モデルが頻繁にパッケージ名を幻覚し、サプライチェーン攻撃のリスクをもたらすことが明らかになりました。研究者らは16のモデルをテストし、57万6,000件のコードサンプルを生成したところ、平均して推奨パッケージの19.7%が架空のものでした。また、緩和策も提案しています。
「We Have a Package for You!」という研究は、コード生成LLMによるパッケージ幻覚を分析しました。研究者らは、GPT-3.5、GPT-4、GPT-4 Turbo、CodeLlama、DeepSeek Coderなどを含む16のモデルをテストし、PythonとJavaScript用に57万6,000のコードサンプルを生成しました。その結果、44万445件の推奨(19.7%)が幻覚であり、商用モデルでは少なくとも5.2%、オープンモデルでは21.7%の幻覚が見られました。モデルは最近のトピックに関して幻覚を起こしやすく、温度を下げることでリスクは軽減されましたが、完全にはなくなりませんでした。この研究はまた、モデルが自身の幻覚を繰り返すことが多いことや、幻覚名の大半が実際のパッケージの単純なタイポではないことを示しました。この研究はUSENIX Security 2025でDistinguished Paper Awardを受賞しました。
出典: Habr — хаб ИИ —
原文
