TutkimusMallit 🇺🇸 27.07.2026 17:06

MIT:n tutkijat esittelevät SEAL:in: askel kohti itseään parantavaa tekoälyä

MITMIT MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI DeepMindDeepMind
MIT:n tiimi julkaisi artikkelin "Self-Adapting Language Models" ja SEAL-viitekehyksen, joka mahdollistaa suurten kielimallien omien painojen päivittämisen itseeditoroinnin ja vahvistusoppimisen avulla. Kokeet Llama-3.2-1B-Instruct- ja Qwen2.5-7B-malleilla osoittivat merkittäviä parannuksia vähän esimerkkejä vaativassa oppimisessa ja tiedon integroinnissa.
Tutkijat Massachusetts Institute of Technologystä (MIT) esittelivät SEAL-nimisen (Self-Adapting LLMs) viitekehyksen, jonka avulla suuret kielimallit (large language models, LLM) voivat päivittää omia painojaan. SEAL käyttää vahvistusoppimista (reinforcement learning, RL) tuottaakseen ”itseeditointi”-toimintoja – synteettistä dataa, jolla mallia hienosäädetään. Ulkoinen RL-silmukka optimoi editointien tuottamisprosessia, kun taas sisäinen silmukka soveltaa niitä gradienttilaskun avulla. Koulutuksen vakauden varmistamiseksi kirjoittajat valitsivat PPO:n ja GRPO:n sijasta DeepMindin ReST^EM-menetelmän. Viitekehystä testattiin kahdessa skenaariossa: muutaman otoksen oppiminen (few-shot learning) (Llama-3.2-1B-Instruct-mallilla) ja tiedon integrointi (Qwen2.5-7B-mallilla). Muutaman otoksen oppimisessa adaptaation tarkkuus saavutti 72,5 prosenttia, kun RL:tä käyttämättömän mallin tarkkuus oli 20 prosenttia. Tiedon integroinnissa SEAL ylitti lähtötason (baseline) jopa synteettisellä datalla, ja kahden RL-iteraation jälkeen se päihitti GPT-4.1:tä käyttävät menetelmät. Työ herätti laajaa keskustelua muun muassa Hacker Newsissa, kun kiinnostus tekoälyn itsekehittymiseen kasvaa – äskettäin on ilmestynyt projekteja Sakana AI:lta, CMU:lta, SJTU:lta ja muilta. OpenAI:n Sam Altman kirjoitti blogissaan ”The Gentle Singularity” myös itseparantuvan tekoälyn ja robottien tulevaisuudesta. Artikkelissa mainitaan SEAL:n rajoituksia, kuten katastrofaalinen unohtaminen ja laskennalliset kustannukset.
Lähde: Synced — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset