Miksi tekoälyagentti on oikeasti halvempi kuin RAG
Vaikka klassinen RAG-assistentti näyttää halvemmalta kyselyä kohden, piilokustannukset, kuten käyttäjän jatkokyselyt ja operaattorille ohjaamiset, tekevät siitä kokonaisuutena kalliimman. ReAct-silmukkaa käyttävä agentti etsii autonomisesti useista asiakirjoista, kunnes löytää täydellisen vastauksen, muuttaen 3-yrityksen 27 minuutin prosessin yhdeksi 4 minuutin vastaukseksi. Todellinen pilottidata tukiprojektista vahvistaa, että agentit sulkevat kyselyitä kolmanneksella RAG-assistentin kustannuksista.
Artikkelin mukaan naiivi kustannusvertailu RAG-assistentin ja agentin välillä on harhaanjohtava. Klassinen RAG-assistentti tekee yhden LLM-kutsun ja luottaa siihen, että käyttäjä tarkentaa kyselyä, jos vastaus on väärä. Käytännössä käyttäjät luovuttavat usein 2–3 yrityksen jälkeen, jolloin tapaus siirtyy ihmisoperaattorille, joka käyttää 10–15 minuuttia ongelman ratkaisemiseen. Tämä kasvattaa kustannukset paljon yhden LLM-kutsun yli. ReAct-silmukkaan perustuva agentti iteroi itsenäisesti hakutyökaluja, muodostaa hypoteeseja, hakee osioita ja syntetisoi lopullisen vastauksen ilman käyttäjän väliintuloa. Kirjoittajan ISTOK-agentti käyttää viittä työkalua: VectorSearch (hybridi dense+BM25 Milvusin avulla), Search (PostgreSQL-kokotekstihaku), OpenChunk koko dokumenttiosion lukemiseen, GetDocumentChunks sisällysluetteloa varten ja CallOperator viimeisenä keinona 2–3 oman yrityksen jälkeen. Hallitakseen konteksti-ikkunan rajoituksia agentti kokeili ensin LLM-koostetta, mutta se osoittautui kalliiksi ja epäluotettavaksi; nyt se käyttää liukuvaa ikkunaa (säilytä viimeiset 6 viestiä, poista vanhimmat työkalut) ja tiivistystä varavaihtoehtona (max 2 istuntoa kohti). Myös LLM-kutsut on eriytetty: halvat upotukset ja uudelleenjärjestys, kevyt generointi yksinkertaisiin vaiheisiin, keskiraskas tyypilliseen päättelyyn ja raskas vain lopullista synteesiä tai tiivistystä varten. Oikeassa pilottiprojektissa, jossa oli noin 1 200 dokumenttia ja 1 800 kuukausittaista pyyntöä, assistentti käytti keskimäärin 1 LLM-kutsua, 2,3 käyttäjän jatkokysymystä, eskalaatioaste oli 34 prosenttia, ratkaisuaika 27 minuuttia ja noin 18 000 tokenia suljettua kysymystä kohden. Agentti käytti keskimäärin 6,4 LLM-kutsua, 0,3 jatkokysymystä, eskalaatioaste 11 prosenttia, ratkaisuaika 4 minuuttia ja noin 15 500 tokenia. Suorissa kustannuksissa assistentin suljettu kysymys maksoi noin 52 ruplaa (mukaan lukien operaattorikustannukset), kun agentin kustannus oli noin 17 ruplaa, eli kolminkertainen vähennys. Agentin etu katoaa yksinkertaisissa faktakysymyksissä tai kun tietokanta on tyhjä, sillä se tekee turhia iteraatioita. Agentti kirjaa jokaisen kutsun token-käytön ja työkaluhistorian, ja jäljitys tapahtuu Arize Phoenixin avulla, joka antaa yksityiskohtaisen erittelyn iteraatioista.
Lähde: Habr — хаб ИИ —
Alkuperäinen
