PSU:n ja Duken tutkijat esittelivät automaattisen vikojen kohdistamisen moniagenttijärjestelmissä
Google DeepMind
Meta
OpenAI
DeepSeek
Penn State Universityn ja Duke Universityn tutkijat yhteistyössä Google DeepMindin ja muiden kanssa ovat formalisoineet automaattisen vikojen kohdistamisen ongelman LLM-moniagenttijärjestelmissä. He loivat ensimmäisen vertailuaineiston Who&When ja arvioivat useita menetelmiä havaiten, että parhaatkin lähestymistavat saavuttavat vain 53,5 prosentin tarkkuuden vastuullisen agentin tunnistamisessa.
Pennsylvanian osavaltionyliopiston ja Duken yliopiston tiimi yhdessä Google DeepMindin, Washingtonin yliopiston, Metan, NTU:n ja Oregonin osavaltionyliopiston tutkijoiden kanssa on määritellyt uuden tutkimusongelman: automaattinen virheiden kohdistaminen kielimallipohjaisissa moniagenttijärjestelmissä. He loivat ensimmäisen viiteaineiston Who&When, joka sisältää virhelokeja 127:stä moniagenttijärjestelmästä, joissa on ihmisen tekemät merkinnät vastuussa olevasta agentista, ratkaisevasta virheaskeleesta ja luonnollisen kielen selityksestä. Tutkijat kehittivät ja arvioivat kolme kohdistusmenetelmää: kaikki kerralla, askel askeleelta ja binäärihaku. Kokeissa, joissa käytettiin GPT-4oa, paras yksittäinen menetelmä saavutti vain 53,5 prosentin tarkkuuden vastuullisen agentin tunnistamisessa ja 14,2 prosentin tarkkuuden virheaskeleen paikantamisessa. Hybridimenetelmät paransivat suorituskykyä, mutta korkeammalla laskentakustannuksella. Artikkeli on hyväksytty esitykseksi ICML 2025 -konferenssiin, ja koodi ja aineisto on avointa lähdekoodia.
Lähde: Synced —
Alkuperäinen
