Meta AI ehdottaa toista tekoälyagenttia pitämään pitkät tehtävät raiteillaan
Meta
Anthropic
Meta AI:n tutkijat ovat kehittäneet muistimoduulin, joka käyttää erillistä 'muistiagenttia' lisäämään valikoivasti muistutuksia 'toiminta-agentille' pitkien tehtävien aikana, mikä estää 'käyttäytymistilan heikkenemisen'. Testit Terminal-Bench 2.0- ja τ2-Bench-ympäristöissä osoittivat merkittäviä parannuksia, erityisesti heikompien agenttien kohdalla, ja koodi on avoimen lähdekoodin saatavilla GitHubissa.
Tutkimuspaperissaan Meta AI:n tutkijat kuvaavat toistuvan ongelman, jossa tekoälyagentit menettävät vaatimukset tai toistavat epäonnistuneita toimintoja pitkien tehtävien aikana. Tätä ilmiötä he kutsuvat 'behavioraaliseksi tilan heikkenemiseksi'. He ehdottavat plug-and-play-muistimoduulia, joka suorittaa erillistä 'muistiagenttia' muuttumattoman 'toiminta-agentin' rinnalla. Moduuli tarkkailee viimeisimpiä vaiheita kiintein väliajoin, päivittää jäsenneltyä muistipankkia ja päättää, syöttääkö se seuraavaan toimintakutsuun ytimekkään muistipohjaisen muistutuksen vai pysyykö se hiljaa. Muistipankki on jaettu yksityisen tilan, tiedon ja proseduraalisiin muistoihin, ja agentti hallinnoi pankkia ennalta määriteltyjen työkalukutsujen avulla, ei vapaalla uudelleenkirjoituksella. Testit suoritettiin Terminal-Bench 2.0- ja τ2-Bench-ympäristöissä käyttäen Claude Opus 4.6:ta muistiagenttina. Kun toiminta-agenttina toimi Claude Sonnet 4.5, järjestelmä ratkaisi 46% Terminal-Bench-tehtävistä ensimmäisellä yrittämällä, kun aiempi osuus oli 38%, ja paransi τ2-Bench-tehtäväpainotetun keskiarvon 55%:sta 62%:iin. Huomattavia eroja oli toimialoittain: Airline ja Retail paranivat kumpikin noin 10 prosenttiyksikköä, kun taas Telecom parani vain 3 prosenttiyksikköä. Vahvempi Opus 4.6 parani myös, mutta vähemmän, mikä viittaa siihen, että hyöty ei johdu pelkästään rajallisen kapasiteetin kompensoinnista. Ablaatiot osoittivat, että selektiivinen interventio ja ylläpidetty muistipankki ovat avainasemassa, ja menetelmä ylitti tuottavan muistikerroksen Mem0:n. Tiimi tutki myös avoimen mallin, Qwen3.5-27B:n, kouluttamista muistiagentiksi ja havaitsi, että ohjattu hienosäätö ja vahvistusoppiminen olivat tarpeen interventioiden asianmukaiseksi kalibroimiseksi. Meta AI julkaisi koodin GitHubissa.
Lähde: The Decoder (DE) —
Alkuperäinen
