Исследователи MIT представили SEAL — новый шаг к самообучающемуся ИИ
MIT
DeepMind
Meta
Alibaba/Qwen
OpenAI
Sakana AI
Команда MIT представила SEAL — фреймворк, позволяющий большим языковым моделям обновлять собственные веса через генерацию синтетических данных и обучение с подкреплением. Эксперименты показали значительное улучшение адаптации моделей в задачах few-shot обучения и интеграции знаний. Работа усиливает интерес к теме самоэволюции ИИ, которую недавно комментировал Сэм Альтман.
В статье «Self-Adapting Language Models» исследователи Массачусетского технологического института (MIT) представили фреймворк SEAL (Self-Adapting LLMs), который позволяет большим языковым моделям (LLM) генерировать собственные обучающие данные через «саморедактирование» и обновлять свои веса на основе новых входных данных. Процесс саморедактирования обучается с помощью подкрепления, где награда привязана к производительности обновлённой модели на целевой задаче. SEAL работает по принципу двух вложенных циклов: внешний цикл обучения с подкреплением (RL) оптимизирует генерацию саморедактирований, а внутренний цикл применяет эти редактирования для обновления модели через градиентный спуск. В качестве метода RL авторы использовали ReST^EM (Expectation-Maximisation) от DeepMind, отбросив нестабильные PPO и GRPO. Фреймворк был протестирован в двух областях: интеграция знаний и few-shot обучение. В few-shot обучении модель Llama-3.2-1B-Instruct с SEAL достигла 72,5% успешной адаптации против 20% без RL и 0% без адаптации. Для интеграции знаний на Qwen2.5-7B модель превзошла базовые методы, а настройка с RL позволила обогнать подходы с данными от GPT-4.1 всего за две итерации. Публикация совпала с волной интереса к самоэволюции ИИ: ранее вышли работы DGM (Sakana AI и UBC), SRT (CMU), MM-UPT (Шанхайский университет Цзяо Тун) и UI-Genie (Китайский университет Гонконга с vivo). Генеральный директор OpenAI Сэм Альтман в своём посте «The Gentle Singularity» предсказал, что после первоначального производства человекоподобные роботы смогут самостоятельно управлять всей цепочкой поставок для строительства новых роботов и заводов. Также появился неподтверждённый слух @VraserX о том, что OpenAI уже внутри компании запустила рекурсивно самоулучшающийся ИИ. Исследователи MIT признали ограничения SEAL, включая катастрофическое забывание, вычислительные затраты и зависимость оценки от контекста.
- Сокращения
- LLM = Large Language Model — большая языковая модель
- RL = Reinforcement Learning — обучение с подкреплением
- PPO = Proximal Policy Optimization — оптимизация проксимальной политики
- GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
- EM = Expectation-Maximization — ожидание-максимизация
- SFT = Supervised Fine-Tuning — контролируемая тонкая настройка
Источник: Synced —
оригинал
