Automaattinen syyn kohdistaminen LLM-pohjaisissa moniagenttijärjestelmissä: uusi tutkimus
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
Penn State Universityn ja Duke Universityn tutkijat yhteistyössä Google DeepMindin kanssa esittelivät automaattisen vian kohdistamisen tehtävän LLM-pohjaisissa moniagenttijärjestelmissä. He kehittivät Who&When-vertailuarvon, joka sisältää 127 vikalokia ja kolme kohdistusmenetelmää (kaikki kerralla, askel askeleelta, binäärihaku). Kokeet osoittivat, että jopa parhaat mallit (GPT-4o, o1, DeepSeek R1) suoriutuvat huonosti: vastuullisen agentin tunnistamisen tarkkuus on noin 53,5 prosenttia ja virheaskeleen tarkkuus vain 14,2 prosenttia.
Pennsylvanian osavaltionyliopiston ja Duke-yliopiston tutkijat yhdessä Google DeepMindin, Washingtonin yliopiston, Metan, Nanyangin teknillisen yliopiston ja Oregonin osavaltionyliopiston kanssa ovat ensimmäistä kertaa formalisoineet automaattisen vian kohdistamisen tehtävän suuriin kielimalleihin (LLM, large language model) perustuvissa moniagenttijärjestelmissä. He loivat ensimmäisen vertailuaineiston, Who&When, joka sisältää 127 vikalokia, jotka on kerätty LLM-agenttijärjestelmistä, sekä algoritmisesti tuotettuja että asiantuntijoiden manuaalisesti laatimia. Jokainen loki sisältää merkinnät: vastuussa oleva agentti (Who), virheaskel (When) ja kuvaus syystä (Why). Tehtävälle ehdotetaan kolmea menetelmää: All-at-Once (koko lokin samanaikainen analyysi), Step-by-Step (askelittainen tarkastelu) ja Binary Search (binäärihaku lokista). Kokeet GPT-4o:lla osoittivat, että paras yksittäinen menetelmä saavuttaa 53,5 prosentin tarkkuuden vastuuagentin tunnistamisessa ja vain 14,2 prosentin tarkkuuden virheaskeleen tarkassa paikantamisessa. Mikään menetelmä ei ylitä satunnaisarvauksen tasoa monilla mittareilla. Jopa edistyneet mallit, kuten o1 ja DeepSeek R1, tuottavat vaikeuksia. Hybridimenetelmät parantavat tuloksia mutta lisäävät merkittävästi laskentakustannuksia. Kontekstin pituuden kasvaessa kaikkien menetelmien suorituskyky heikkenee, erityisesti virheaskeleen määrittämisessä. Työ hyväksyttiin Spotlight-esitykseksi ICML 2025 -konferenssiin; koodi ja data ovat avoimesti saatavilla.
Lähde: Synced —
Alkuperäinen
