研究模型 🇺🇸 27.07.2026 17:06

MIT 推出 SEAL:迈向自我改进 AI 的新一步

MITMIT MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI DeepMindDeepMind
麻省理工学院的研究人员提出了 SEAL(Self-Adapting LLMs,即自适应大语言模型)框架,该框架使大语言模型能够通过强化学习更新自身权重。该方法通过生成自我编辑来产生训练数据,并在下游任务上提升性能。在少样本学习和知识整合上的实验结果显示,其性能显著优于基线模型。
MIT 研究员发表了一篇题为《自适应语言模型》(Self-Adapting Language Models)的论文,提出了 SEAL 框架,该框架允许大型语言模型(LLM)更新自身权重。该模型通过自我编辑生成合成训练数据,并借助强化学习进行学习;奖励基于更新后的模型在下游任务中的表现。在 Llama-3.2-1B-Instruct 的少样本学习实验中,SEAL 达到了 72.5% 的适应成功率,远超基线水平。在 Qwen2.5-7B 的知识集成任务中,SEAL 持续优于基线,有时在两次迭代后便超越 GPT-4.1 生成的数据。论文指出了局限性,包括灾难性遗忘和计算开销。该研究的发布正值对自进化 AI 兴趣日益浓厚的时期,相关成果还包括来自 Sakana AI/英属哥伦比亚大学(UBC)、卡内基梅隆大学(CMU)、上海交通大学(SJTU)以及香港中文大学(CUHK)/vivo 的工作,OpenAI CEO 萨姆·奥尔特曼也曾就此发表评论。
来源: Synced — 原文
我们之前关于此话题的帖子 ↓
最新新闻