SkillOpt: tekoälyagentin taidot muutettaviksi parametreiksi
Microsoft
OpenAI
Alibaba/Qwen
Microsoft Research esittelee SkillOpt-menetelmän, joka käsittelee agentin taitotiedostoja koulutettavina parametreina jäädytetyn mallin ulkopuolella ja optimoi niitä hallittujen tekstimuokkausten avulla. 52 arviointisolussa, joissa käytettiin kuutta vertailuarvoa, seitsemää mallia ja kolmea suoritustilaa, SkillOpt ylittää johdonmukaisesti perustasot saavuttaen jopa +23,5 pisteen parannuksen ilman mallipainojen muokkausta. Optimoidut taidot siirtyvät mallikokojen ja agenttivaljaiden välillä pysyen kompakteina ja tarkastettavina.
Microsoft Research -tutkimusryhmän artikkeli 'SkillOpt: Executive Strategy for Self-Evolving Agent Skills' uudelleenmuotoilee agenttitaitojen muokkaamisen koulutusprosessiksi. SkillOpt käsittelee taitotiedostoa koulutettavana parametrina jäädytetyn kohdemallin ulkopuolella ja käyttää eteenpäin-taaksepäin-päivitys-sykliä tekstiavaruudessa. Eteenpäin suuntautuvassa vaiheessa jäädytetty malli suorittaa koulutustehtäviä; taaksepäin suuntautuvassa vaiheessa optimointimalli analysoi kulkuja; päivitysvaihe ehdottaa rajattuja muokkauksia, jotka validointitarkastus hyväksyy tai hylkää. Hylätyt muokkaukset tallennetaan negatiivista palautetta varten, ja hidas/metapäivitys kokoaa pidemmän aikavälin opit. Kuudella vertailuarvolla (SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld) testattuna, seitsemällä kohdemallilla (GPT-5.5:stä Qwen3.5-4B:hen) ja kolmella suoritustavalla (suora chat, Codex, Claude Code) SkillOpt saavutti parhaat tai jaetusti parhaat tulokset kaikissa 52 solussa. GPT-5.5:llä suorassa chatissa kuuden vertailuarvon keskiarvo nousi arvosta 58,8 arvoon 82,3 (+23,5 pistettä). Suurimmat parannukset saavutettiin proseduraalisilla vertailuarvoilla: SpreadsheetBench nousi 41,8:sta 80,7:ään, OfficeQA 33,1:stä 72,1:een ja LiveMathematicianBench 37,6:sta 66,9:ään. Optimoidut taidot siirtyivät mallikokojen, käyttötapojen ja liittyvien tehtävien välillä; esimerkiksi Codexissa koulutettu laskentataulukkotaito siirrettynä Claude Codeen paransi taitotonta perustasoa 22,1:stä 81,8:aan (+59,7). Lopulliset taitotiedostot pysyivät kompakteina (mediaani noin 900 tokenia) ja niissä oli vain 1-4 hyväksyttyä muokkausta. SkillOpt viittaa siihen, että koulutusta voidaan soveltaa proseduraaliseen tietoon mallipainojen ulkopuolella, tarjoten hallittavan ja auditoitavan sovituskerroksen agenttimaisille työnkuluille.
Lähde: Microsoft Research —
Alkuperäinen
