研究智能体 🇺🇸 31.07.2026 00:02

Science One框架:通过证据链实现可验证的自主研究

Google/DeepMindGoogle/DeepMind Sakana AISakana AI
Google Research推出Science One框架,这是一款自主研究原型,通过构建可验证的证据链消除幻觉,同时引入CoE审计协议自动评估AI生成论文的完整性。结果表明,Science One在实现零虚假引用和完全可验证评分的同时,在基准测试中达到或超过人类专家表现。
谷歌研究院推出了Science One框架,这是一个自主研究原型,旨在通过原生构建可验证的证据链来消除幻觉,同时推出了CoE审计协议,这是一个用于评估AI生成论文完整性的自动化协议。该框架基于证据链(CoE),这是一个新的可验证性概念,要求研究产物中的每个主张都有记录在案的证据链(完整性),并且每条链都能真实支持该主张(正确性)。Science One框架通过三个主要模块实例化CoE:思想探索器、问题调查器和解决方案开发者。CoE审计应用了四项严格的完整性检查:参考文献验证、分数验证、代码可重复性以及方法-代码一致性。在ADRS基准的75篇论文评估中,Science One实现了零虚假参考文献(相比之下,基线幻觉率高达21%)、完美的分数验证以及最高的方法-代码一致性,同时在所有五项ADRS任务中达到或超过人类专家水平。该框架还在包括MLE-Bench和Parameter-Golf在内的六项外部复杂任务上进行了测试,取得了最先进的结果。
来源: Google Research — 原文
我们之前关于此话题的帖子 ↓
最新新闻