自动研究时代:我一觉醒来,40个假设已被测试完毕——接下来该怎么办,如何继续工作?
Google/DeepMind
OpenAI
DeepMind
Anthropic
一位工程师描述了他如何利用AI智能体自动化假设测试,一夜之间测试了40个假设。他阐述了从寻找解决方案到构建能够自动寻找解决方案的系统的转变,并讨论了来自sankalp、Karpathy和DeepMind的案例。他还涉及了诸如损失对齐和预言机设计等陷阱,以及模型选择的重要性。
一位工程师描述了他如何不手动测试假设,而是写下了假设生成流程的文字描述,让Gemini评判每次尝试,并让代理程序整夜运行。到了早上,日志显示已经测试了40个假设。他对比了自己早期的天真尝试(并行运行十个代理而没有计划)和第二次尝试(给代理详细的议程),与那个奏效的懒惰晚间方法。他解释说,关键不在于更好地控制代理,而在于谁评估结果。他引用了先例:sankalp的QR分解在批量QR上实现了232倍的加速,Karpathy的630行自动研究脚本一夜之间运行了数百个实验,DeepMind的AlphaEvolve改进了50个开放数学问题中20%的解决方案,并加速了谷歌的数据中心、芯片设计和人工智能训练。他分享两个个人案例:在第一个案例中,他花了两周时间手工制作数据集过滤器,但一个基于Gemini的预言机加上视觉语言模型在几次运行中就击败了它;在第二个案例中,他获得了30%的训练加速,但遇到了陷阱:他忘记包含损失一致性检查(导致NaN损失),而且一个不够详细的预言机忽略了诸如图像文本移除中残留字母之类的伪影。他强调,构建一个好的预言机和循环是真正的工作,而循环中的模型很重要。他总结说,专业知识正在从“找到解决方案”转变为“构建能找到解决方案的系统”。
来源: Habr — хаб ИИ —
原文
