Исследователи MIT представили SEAL — новый шаг к самоулучшающемуся ИИ
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
Команда MIT опубликовала работу «Self-Adapting Language Models» с фреймворком SEAL, позволяющим большим языковым моделям обновлять собственные веса через саморедактирование и обучение с подкреплением. Эксперименты на Llama-3.2-1B-Instruct и Qwen2.5-7B показали значительное улучшение в few-shot обучении и интеграции знаний.
Исследователи из Массачусетского технологического института (MIT) представили фреймворк SEAL (Self-Adapting LLMs), который позволяет большим языковым моделям (LLM) обновлять собственные веса. SEAL использует обучение с подкреплением (RL) для генерации «саморедактирований» — синтетических данных, на которых модель дообучается. Внешний RL-цикл оптимизирует процесс генерации редактирований, а
Показать ещё ↓
- Сокращения
- MIT = Massachusetts Institute of Technology — Массачусетский технологический институт
- SEAL = Self-Adapting LLMs — самоадаптирующиеся большие языковые модели
- LLM = Large Language Model — большая языковая модель
- RL = Reinforcement Learning — обучение с подкреплением
- ReST^EM = Reinforced Self-Training with Expectation-Maximization — усиленное самообучение с максимизацией ожидания
- PPO = Proximal Policy Optimization — оптимизация проксимальной политики
- GRPO = Group Relative Policy Optimization — групповая относительная оптимизация политики
Источник: Synced —
оригинал
