MIT Introduceert SEAL: Een Nieuwe Stap naar Zelfverbeterende AI
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
Onderzoekers van MIT hebben SEAL (Self-Adapting LLMs) voorgesteld, een raamwerk dat grote taalmodellen in staat stelt om hun eigen gewichten bij te werken via reinforcement learning. De methode genereert zelfbewerkingen om trainingsdata te produceren en verbetert de prestaties op downstream taken. Experimentele resultaten op few-shot learning en kennisintegratie laten aanzienlijke verbeteringen zien ten opzichte van benchmarks.
MIT-onderzoekers publiceerden een paper getiteld 'Self-Adapting Language Models', waarin SEAL wordt geïntroduceerd, een raamwerk dat grote taalmodellen (large language models, LLM's) in staat stelt hun eigen gewichten bij te werken. Het model genereert synthetische trainingsdata door middel van zelfbewerking, die wordt aangeleerd via versterkend leren (reinforcement learning). De beloning is gebaseerd op de downstream-prestaties van het bijgewerkte model. Experimenten met few-shot learning met Llama-3.2-1B-Instruct leverden een aanpassingssuccespercentage van 72,5% op, ver boven de basislijnen. Bij kennisintegratie met Qwen2.5-7B presteerde SEAL consistent beter dan de basislijnen, waarbij het na twee iteraties soms gegenereerde data van GPT-4.1 overtrof. Het paper vermeldt beperkingen waaronder catastrofaal vergeten en computationele overhead. De timing valt samen met een groeiende belangstelling voor zelf-evoluerende AI, met onder meer gerelateerd werk van Sakana AI/UBC, CMU, SJTU en CUHK/vivo, evenals opmerkingen van OpenAI-CEO Sam Altman.
Bron: Synced —
origineel
