PSU:n ja Duken tutkijat esittelevät automaattisen vianmäärityksen monitoimijärjestelmille
Google DeepMind
Meta
OpenAI
DeepSeek
Penn State Universityn ja Duke Universityn tutkijat yhteistyössä Google DeepMindin ja muiden kanssa ovat formalisoineet automaattisen vianmäärityksen ongelman LLM-pohjaisissa monitoimijärjestelmissä. He loivat ensimmäisen vertailuaineiston, nimeltään Who&When, ja arvioivat useita menetelmiä, joista parhaatkin saavuttivat vain 53,5 prosentin tarkkuuden vastuullisen toimijan tunnistamisessa.
Pennsylvanian osavaltionyliopiston ja Duken yliopiston tiimi yhdessä Google DeepMindin, Washingtonin yliopiston, Metan, NTU:n ja Oregonin osavaltionyliopiston tutkijoiden kanssa on määritellyt uuden tutkimusongelman: automaattinen virheiden kohdistaminen kielimallipohjaisissa moniagenttijärjestelmissä. He loivat ensimmäisen viiteaineiston Who&When, joka sisältää virhelokeja 127:stä moniagenttijärjestelmästä, joissa on ihmisen tekemät merkinnät vastuussa olevasta agentista, ratkaisevasta virheaskeleesta ja luonnollisen kielen selityksestä. Tutkijat kehittivät ja arvioivat kolme kohdistusmenetelmää: kaikki kerralla, askel askeleelta ja binäärihaku. Kokeissa, joissa käytettiin GPT-4oa, paras yksittäinen menetelmä saavutti vain 53,5 prosentin tarkkuuden vastuullisen agentin tunnistamisessa ja 14,2 prosentin tarkkuuden virheaskeleen paikantamisessa. Hybridimenetelmät paransivat suorituskykyä, mutta korkeammalla laskentakustannuksella. Artikkeli on hyväksytty esitykseksi ICML 2025 -konferenssiin, ja koodi ja aineisto on avointa lähdekoodia.
Lähde: Synced —
Alkuperäinen
