Google:推論が言語モデルの事実想起を助ける――バッファとプライミングの仕組み
Google/DeepMind
Alibaba/Qwen
Google Researchは、LLMに推論を有効にすることで、2つのメカニズム(追加トークンが計算バッファとして機能することと、関連する事実を生成することで正しい想起がプライミングされること)を通じて単純な事実の想起が改善されることを発見した。この研究では、Gemini-2.5とQwen3-32BをQAデータセットでテストしている。
Google Researchは、複雑な推論手順を必要としない単純な事実をLLMが想起する際に、なぜ推論が役立つのかを研究した。彼らは2つのメカニズムを発見した。すなわち、余分な無意味なトークンがより多くの処理を提供する計算バッファと、関連する事実を生成することで正しい想起を促進する事実プライミングである。実験では、Gemini-2.5(FlashおよびPro)とQwen3-32Bを用いて、SimpleQA VerifiedデータセットとEntityQuestionsデータセットで検証を行った。バッファ効果は想起の改善に寄与したが、収穫逓減の傾向があり、一方で自然な推論過程で関連事実が頻繁に現れることで最高のパフォーマンスが得られた。幻覚による中間事実は精度を低下させた。幻覚を含まない軌跡を維持するテスト時選択戦略により、結果が改善された。
出典: Google Research —
原文
