MIT Researchers Introduce SEAL: A Step Toward Self-Improving AI
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
A team from MIT published the paper "Self-Adapting Language Models" with the SEAL framework, enabling large language models to update their own weights through self-editing and reinforcement learning. Experiments on Llama-3.2-1B-Instruct and Qwen2.5-7B showed significant improvements in few-shot learning and knowledge integration.
Исследователи из MIT представили фреймворк SEAL (Self-Adapting LLMs), который позволяет большим языковым моделям (LLM) обновлять собственные веса. SEAL использует обучение с подкреплением (RL) для генерации «саморедактирований» — синтетических данных, на которых модель дообучается. Внешний RL-цикл оптимизирует процесс генерации редактирований, а внутренний — применяет их через градиентный спуск. Для стабильности обучения вместо PPO и GRPO авторы выбрали метод ReST^EM от DeepMind. Фреймворк протестировали в двух сценариях: few-shot обучение (на Llama-3.2-1B-Instruct) и интеграция знаний (на Qwen2.5-7B). В few-shot точность адаптации достигла 72,5% против 20% у модели без RL. При интеграции знаний SEAL превзошёл baseline даже с синтетическими данными, а после двух итераций RL обогнал подходы, использующие GPT-4.1. Работа вызвала широкое обсуждение, в том числе на Hacker News, на фоне растущего интереса к самоэволюции ИИ — недавно появились проекты Sakana AI, CMU, SJTU и других. OpenAI Сэм Альтман в блоге «The Gentle Singularity» также писал о будущем самоулучшающегося ИИ и роботов. В статье отмечены ограничения SEAL, включая катастрофическое забывание и вычислительные затраты.
Nguồn: Synced —
bản gốc
