jump”的立场文件中,谷歌DeepMind的汤姆·扎哈维认为,语言模型无法引发科学革命,因为它们缺乏创造真正新思想的关键认知机制。他以爱因斯坦的发现模型为循环:从感官经验经由直觉的“跳跃”到达公理,再通过逻辑推导得出可检验的结论。扎哈维区分了三种推理类型:演绎、归纳和溯因,并声称语言模型擅长归纳和演绎,但不擅长“操作性溯因”——即发明一个尚无语言模板的原因。他以爱因斯坦的工作为例,指出当时并不存在数据危机;牛顿物理学高度精确,只有水星轨道的一个微小异常,而一个纯粹优化的AI可能会发明一个假设的行星,而不是重新思考时间和空间。扎哈维认为,爱因斯坦的“最幸福的想法”——自由下落的观察者——源于具身模拟,一种身体的感觉,而非公式操作。他将其与阿基米德在浴缸中的“尤里卡”时刻相比较。语言模型缺乏这种感官基础;它们就像“中文房间”——操作符号而不接触具身体验。他指出,像Sakana的AI科学家和DeepMind的AlphaEvolve这样的系统可以自动化科学,但要么重组现有概念,要么需要明确的错误信号,而爱因斯坦从未有过这样的信号。作为潜在路径,扎哈维建议构建物理一致的世界模型:像Veo这样的视频生成器只预测下一帧,但像Genie这样的行动可控世界模型允许智能体干预并运行反事实实验,从而提供发明新公理所需的反馈。扎哈维保持谨慎,表示该论文“暗示”但并未证明这种跳跃是关键瓶颈。