研究 🇺🇸 14.08.2026 11:03

书架空空还是钥匙丢失?回忆是参数化事实性的瓶颈

Google ResearchGoogle Research OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Google Research引入了知识画像(knowledge profiling)框架,将大语言模型中的编码与回忆分离。通过包含2150个维基百科事实的基准WikiProfile,他们发现像Gemini和GPT-5这样的前沿大语言模型几乎编码了所有事实,但却难以回忆其中许多,瓶颈从知识获取转向了知识利用。
Google Research的科学家Nitay Calderon和Gal Yona提出了一个名为知识画像的行为框架,用以区分大语言模型(LLM)中的事实错误究竟源于知识缺失(编码失败)还是知识不可及(回忆失败)。他们引入了WikiProfile,这是一个包含2150条源自维基百科事实的基准测试,每条事实都配有探测编码、回忆和识别能力的问题。通过对13个有无思考能力的大语言模型进行评估,他们发现像Gemini-3-Pro和GPT-5这样的前沿模型能够编码95%至98%的事实,但在直接回忆时却会失败26%至34%,即便在思考模式下,失败率仍高达11%至12%。在Gemma 3系列中,模型规模的扩大减少了编码失败,但回忆失败依然存在,表明回忆是瓶颈所在。回忆受到训练上下文的影响,长尾事实虽被编码却难以回忆,而反向诅咒则被重新定义为回忆问题,因为多项选择任务中的识别能力并未受损。思考能力最能改善对稀有事实和反向事实的回忆,能够恢复40%至65%已编码但无法直接知晓的事实,其作用机制更像是促进回忆,而非纯粹的推理。
来源: Google Research — 原文
我们之前关于此话题的帖子 ↓
最新新闻