MIT研究人员推出SEAL:迈向自我改进人工智能的一步
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
麻省理工学院的一个团队发表了论文《自适应语言模型》,提出了SEAL框架,使大型语言模型能够通过自我编辑和强化学习更新自身权重。在Llama-3.2-1B-Instruct和Qwen2.5-7B上的实验显示,在少样本学习和知识整合方面有显著提升。
麻省理工学院(MIT)的研究人员提出了SEAL(Self-Adapting LLMs,即自适应大语言模型)框架,该框架使大语言模型(LLM)能够更新自身的权重。SEAL使用强化学习(RL)来生成“自编辑”——一种用于模型微调的合成数据。外部RL循环优化编辑生成过程,内部循环则通过梯度下降应用这些编辑。为了训练的稳定性,作者选择了DeepMind的ReST^EM方法,而非PPO和GRPO。该框架在两个场景中进行了测试:少样本学习(基于Llama-3.2-1B-Instruct)和知识整合(基于Qwen2.5-7B)。在少样本学习中,自适应准确率达到72.5%,而未经RL的模型仅为20%。在知识整合中,即使使用合成数据,SEAL也超越了基线;经过两轮RL迭代后,其表现优于使用GPT-4.1的方法。这项工作引发了广泛讨论,包括在Hacker News上,背景是人们对AI自我进化兴趣日益增长——近期出现了Sakana AI、卡内基梅隆大学(CMU)、上海交通大学(SJTU)等机构的项目。OpenAI的Sam Altman在博客《The Gentle Singularity》中也谈到了未来自我改进的AI和机器人。文章指出了SEAL的局限性,包括灾难性遗忘和计算成本。
来源: Synced —
原文
