Agenten 🇷🇺 30.07.2026 17:01

Waarom een AI-agent eigenlijk goedkoper is dan RAG

Hoewel een klassieke RAG-assistent per query goedkoper lijkt, maken verborgen kosten zoals vervolgvragen van gebruikers en escalaties naar medewerkers het geheel duurder. Een agent die een ReAct-lus gebruikt, doorzoekt autonoom meerdere documenten totdat hij het volledige antwoord vindt, waardoor een proces van 3 pogingen en 27 minuten wordt omgezet in een enkel antwoord van 4 minuten. Echte pilotdata van een supportproject bevestigen dat agents vragen afsluiten tegen een derde van de kosten van een RAG-assistent.
Het artikel betoogt dat de naïeve kostprijsvergelijking tussen een RAG-assistent en een agent misleidend is. Een klassieke RAG-assistent voert één LLM-aanroep uit en vertrouwt erop dat de gebruiker de query verfijnt als het antwoord fout is. In de praktijk geven gebruikers het vaak op na 2 tot 3 pogingen en escaleren ze naar een menselijke operator die 10–15 minuten nodig heeft om het geval op te lossen. Dit leidt tot veel meer dan een enkele LLM-aanroep. Een agent gebaseerd op de ReAct-lus doorloopt autonoom zoektools, formuleert hypothesen, haalt fragmenten op en synthetiseert een definitief antwoord zonder tussenkomst van de gebruiker. De ISTOK-agent van de auteur gebruikt vijf tools: VectorSearch (hybride dense+BM25 via Milvus), Search (PostgreSQL full-text), OpenChunk om volledige documentfragmenten te lezen, GetDocumentChunks voor een inhoudsopgave, en CallOperator als laatste redmiddel na 2 tot 3 eigen pogingen. Om de limieten van het contextvenster te beheren, probeerde de agent eerst LLM-samenvattingen, maar bleek dat duur en onbetrouwbaar; nu gebruikt het een schuivend venster (bewaar laatste 6 berichten, verwijder oudste toolberichten) met samenvatting als vangnet (maximaal 2 per sessie). LLM-aanroepen worden ook gedifferentieerd: goedkope embeddings en herrangschikking, lichte generatie voor eenvoudige stappen, middelzwaar voor typische redeneringen, en zwaar alleen voor de uiteindelijke synthese of samenvatting. In een echte pilot met ~1200 documenten en 1800 maandelijkse verzoeken, had de assistent gemiddeld 1 LLM-aanroep, 2,3 vervolgvragen van de gebruiker, 34% escalatiepercentage, 27 minuten om af te sluiten, en ~18.000 tokens per afgesloten vraag. De agent had gemiddeld 6,4 LLM-aanroepen, 0,3 vervolgvragen, 11% escalatie, 4 minuten om af te sluiten, en ~15.500 tokens. In directe kosten kostte de afgesloten vraag van de assistent ~52 roebel (inclusief operatorkosten), terwijl die van de agent ~17 roebel bedroeg, een drievoudige reductie. Het voordeel van de agent verdwijnt voor eenvoudige feitelijke vragen of wanneer de kennisbank leeg is, omdat het dan iteraties verspilt. De agent logt het tokenverbruik en de toolgeschiedenis van elke aanroep, met tracing via Arize Phoenix voor een gedetailleerde uitsplitsing van iteraties.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws