当题库跟不上时,AI开始自设难题:无尽前沿团队跑通数据级RSI
DP Technology
DeepSeek
来自上海交通大学、深势科技和上海算法创新研究院的中国团队发布了BigBang-V1,这是首个原生使用递归自我改进训练的基础模型。这款35B模型拥有100%AI合成训练数据,在多个科学基准测试上优于万亿参数模型,展示了一个自我进化的数据流水线。
由上海交通大学AI研究院、DP Technology和上海算法创新研究院的研究人员组成的Endless Frontier团队,发布了BigBang-V1,这是首个原生使用递归自我改进(RSI)训练的基座模型。在这种方法中,AI负责问题生成、求解和验证,无需人工逐任务参与即可产生高质量的自进化合成数据。该模型拥有350亿参数,推理时约30亿参数激活,支持26.2万字的超长上下文,并且完全基于针对前沿科学任务合成的AI数据进行训练。在包括长程搜索、编程、科学研究和AI研究在内的基准测试中,它获得了35B模型中的10个第一名,甚至在硬性科学任务如FrontierScience Research和PaperBench上超过了拥有1万亿参数的DeepSeek V4 Pro预览版。其能力示例包括利用连接证据精确定位转座子插入位点,以及通过在冒烟测试中自我纠错将论文复制为可运行代码。团队强调,数据生产系统本身可以优化,需要既前沿又可验证的任务,他们实现了一个双循环流水线:内循环由生成器和评论家智能体组成,负责生成和审查数据;外循环由真实训练结果驱动,用于校准系统。这种数据级别的RSI循环防止了合成数据崩溃,而人类仍然定义目标、预算、风险和验收标准。模型和代码已在Hugging Face和GitHub上开源。
来源: QbitAI 量子位 —
原文
