Eén agentstap — 120.000 tokens: waar ze naartoe gaan en hoe we het hebben opgelost
Een autonome agent kan veel meer tokens verbruiken dan verwacht, door het herhaaldelijk verzenden van de volledige context bij elke stap van de agentlus. Het artikel beschrijft hoe Uma Computer ontdekte dat de werkelijke oorzaak niet de dialooggeschiedenis was, maar de vermenigvuldigde overhead van systeeminstructies, toolschema’s en geheugen, en presenteert drie optimalisaties: het verplaatsen van volume naar on-demand tools, het overschakelen naar een karakterbudget met expliciete afbreekmarkeringen, en transparante snelheidsverwachtingen.
De ontwikkelaars van Uma Computer, een autonome agent die taken uitvoert zoals zoeken op het web, het genereren van media en het knippen van video's, onderzochten waarom één gebruikersverzoek 38 credits kostte in plaats van de verwachte derde daarvan. De facturering toonde 119.208 prompt-tokens en slechts 1.018 completion-tokens, wat betekent dat het model vooral aan het lezen was, niet aan het schrijven. De eerste hypothese was een lange dialooggeschiedenis, maar de daadwerkelijke problematische dialoog had slechts twee berichten met in totaal 530 tekens. Meting onthulde dat de context per stap 13.900 tokens was, en met 9 stappen bereikte het totaal ongeveer 120.000 tokens; de overhead vermenigvuldigd met het aantal stappen in de agentlus. Bovendien reserveert de provider de worst-case kosten met een hoog ingestelde max_tokens, waardoor HTTP 402-fouten optreden, zelfs bij voldoende saldo. De oplossing bestond uit het verplaatsen van vooraf geladen context naar on-demand tools, het gebruik van een tekensbudget met prioriteiten en expliciete afkappingsmarkeringen, en het transparant maken van snelheidsverwachtingen. Het artikel benadrukt dat context nooit stilletjes aan het model onttrokken mag worden, en dat optimalisaties moeten worden geverifieerd aan de hand van concrete gevallen, omdat ze bijna optimaliseerden voor een geval waarin geschiedenis niet relevant was.
Bron: Habr — хаб ML —
origineel
