AI揭示99.2%顶级论文存在缺陷!
OpenAI
近期使用AI智能体进行的审计发现,许多顶级AI会议论文不可复现且包含客观错误。一项研究显示,99.2%的论文至少存在一处错误,平均每篇论文有4.7个错误。这一趋势为学术审计带来了新的研究机遇。
研究人员使用人工智能代理对顶级人工智能会议的论文进行了审计,发现许多已发表的结果无法复现。例如,一项对ICML 2026全部168篇口头报告论文的人工智能代理审计显示,在92篇至少有五个可验证论断的论文中,只有34篇能复现超过40%的结论,仅8篇能复现超过80%。此外,有四篇论文依赖一个已下线的模型,导致其结果永久无法复现。另一项研究开发了一种基于GPT-5的论文检查器,用于分析顶级人工智能会议的论文,发现平均每篇论文包含4.7个客观错误,99.2%的论文至少有一个问题。数学和公式错误最为常见(占54.0%)。NeurIPS论文的平均错误数从2021年的3.8个增加到2025年的5.9个。这些发现凸显了科学可复现性日益严重的问题,并为新研究方向提供了机会,例如审查旧论文并纠正错误。此外,之江实验室的一位理论化学家发现,人工智能预测的沸点与一个75年历史的数据库不同,经过人工验证,人工智能是正确的,从而揭示了百年测量的错误。这表明人工智能现在可以协助重新评估历史科学文献。
来源: QbitAI 量子位 —
原文
