MIT:n tutkijat esittelevät SEAL:in: askel kohti itseään parantavaa tekoälyä
MIT
Meta
Alibaba/Qwen
OpenAI
DeepMind
MIT:n tiimi julkaisi artikkelin "Self-Adapting Language Models" ja SEAL-viitekehyksen, joka mahdollistaa suurten kielimallien omien painojen päivittämisen itseeditoroinnin ja vahvistusoppimisen avulla. Kokeet Llama-3.2-1B-Instruct- ja Qwen2.5-7B-malleilla osoittivat merkittäviä parannuksia vähän esimerkkejä vaativassa oppimisessa ja tiedon integroinnissa.
Tutkijat Massachusetts Institute of Technologystä (MIT) esittelivät SEAL-nimisen (Self-Adapting LLMs) viitekehyksen, jonka avulla suuret kielimallit (large language models, LLM) voivat päivittää omia painojaan. SEAL käyttää vahvistusoppimista (reinforcement learning, RL) tuottaakseen ”itseeditointi”-toimintoja – synteettistä dataa, jolla mallia hienosäädetään. Ulkoinen RL-silmukka optimoi editointien tuottamisprosessia, kun taas sisäinen silmukka soveltaa niitä gradienttilaskun avulla. Koulutuksen vakauden varmistamiseksi kirjoittajat valitsivat PPO:n ja GRPO:n sijasta DeepMindin ReST^EM-menetelmän. Viitekehystä testattiin kahdessa skenaariossa: muutaman otoksen oppiminen (few-shot learning) (Llama-3.2-1B-Instruct-mallilla) ja tiedon integrointi (Qwen2.5-7B-mallilla). Muutaman otoksen oppimisessa adaptaation tarkkuus saavutti 72,5 prosenttia, kun RL:tä käyttämättömän mallin tarkkuus oli 20 prosenttia. Tiedon integroinnissa SEAL ylitti lähtötason (baseline) jopa synteettisellä datalla, ja kahden RL-iteraation jälkeen se päihitti GPT-4.1:tä käyttävät menetelmät. Työ herätti laajaa keskustelua muun muassa Hacker Newsissa, kun kiinnostus tekoälyn itsekehittymiseen kasvaa – äskettäin on ilmestynyt projekteja Sakana AI:lta, CMU:lta, SJTU:lta ja muilta. OpenAI:n Sam Altman kirjoitti blogissaan ”The Gentle Singularity” myös itseparantuvan tekoälyn ja robottien tulevaisuudesta. Artikkelissa mainitaan SEAL:n rajoituksia, kuten katastrofaalinen unohtaminen ja laskennalliset kustannukset.
Lähde: Synced —
Alkuperäinen
