空の棚か、失くした鍵か?想起がパラメトリックな事実性のボトルネック
Google Research
OpenAI
Google/DeepMind
Google Researchは、LLMにおける符号化と想起を分離するフレームワークである知識プロファイリングを導入しました。2,150のWikipediaの事実からなるベンチマークWikiProfileを使用して、GeminiやGPT-5などの最先端LLMはほぼすべての事実を符号化しているものの、多くを想起するのに苦労しており、ボトルネックが知識獲得から活用へ移行していることを発見しました。
Google Researchの科学者Nitay Calderon氏とGal Yona氏は、大規模言語モデル(LLM)における事実誤りの原因が、知識の欠如(符号化の失敗)にあるのか、それとも知識にアクセスできないこと(想起の失敗)にあるのかを区別するための、知識プロファイリングと呼ばれる行動フレームワークを提案しています。彼らは、Wikipedia由来の2,150件の事実をベンチマークとして、各事実に対応する符号化、想起、認識を探る質問をペアにしたWikiProfileを紹介しています。思考あり・なしの13種類のLLMを評価したところ、Gemini-3-ProやGPT-5のような最先端モデルは、事実の95〜98%を符号化しているものの、直接の想起には26〜34%失敗し、思考を有効にしても11〜12%の失敗が見られることが分かりました。Gemma 3ファミリーでのスケーリングは符号化の失敗を減らすものの、想起の失敗は持続し、想起がボトルネックであることを示しています。想起はトレーニングコンテキストの影響を受け、ロングテールの事実は符号化されていても想起しにくく、逆転の呪い(reversal curse)は、多肢選択タスクでの認識が損なわれないことから、想起の問題として再定義されます。思考は、特に稀な事実や逆転した事実に対して想起を最も向上させ、符号化されているが直接は知られていない事実の40〜65%を回復させ、純粋な推論ではなく想起を促進するメカニズムとして機能します。
出典: Google Research —
原文
