MIT apresenta SEAL: Um novo passo em direção à IA autoaprimorável
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
Pesquisadores do MIT propuseram o SEAL (Self-Adapting LLMs), uma estrutura que permite que grandes modelos de linguagem atualizem seus próprios pesos por meio de aprendizado por reforço. O método gera autoedições para produzir dados de treinamento e melhora o desempenho em tarefas subsequentes. Resultados experimentais em aprendizado com poucos exemplos e integração de conhecimento mostram ganhos significativos em relação às abordagens de referência.
Pesquisadores do MIT publicaram um artigo intitulado 'Self-Adapting Language Models', apresentando o SEAL, uma estrutura que permite que grandes modelos de linguagem (LLMs) atualizem seus próprios pesos. O modelo gera dados de treinamento sintéticos por meio de autoedição, que é aprendida via aprendizado por reforço. A recompensa é baseada no desempenho downstream do modelo atualizado. Experimentos de aprendizado de poucos exemplos com o Llama-3.2-1B-Instruct alcançaram uma taxa de sucesso de adaptação de 72,5%, muito acima dos baselines. Na integração de conhecimento com o Qwen2.5-7B, o SEAL superou consistentemente os baselines, às vezes superando os dados gerados pelo GPT-4.1 após duas iterações. O artigo observa limitações, incluindo esquecimento catastrófico e sobrecarga computacional. O momento coincide com um interesse crescente em IA autoevolutiva, incluindo trabalhos relacionados de Sakana AI/UBC, CMU, SJTU e CUHK/vivo, bem como comentários do CEO da OpenAI, Sam Altman.
Fonte: Synced —
original
