Ein Agent-Schritt – 120.000 Tokens: Wohin sie gehen und wie wir das Problem behoben haben
Ein autonomer Agent kann weit mehr Tokens verbrauchen als erwartet, da bei jedem Schritt der Agentenschleife der vollständige Kontext erneut gesendet wird. Der Artikel beschreibt, wie Uma Computer herausfand, dass die eigentliche Ursache nicht der Dialogverlauf war, sondern der vervielfachte Overhead durch Systemanweisungen, Tool-Schemas und Speicher, und stellt drei Optimierungen vor: Verlagerung des Volumens auf Tools auf Abruf, Umstellung auf ein Zeichenbudget mit expliziten Abschneidemarkierungen und transparente Geschwindigkeitserwartungen.
Die Entwickler von Uma Computer, einem autonomen Agenten, der Aufgaben wie Websuche, Mediengenerierung und Videoclip-Erstellung übernimmt, untersuchten, warum eine Nutzeranfrage 38 Credits kostete statt des erwarteten Drittels davon. Die Abrechnung zeigte 119.208 Prompt-Token und nur 1.018 Completion-Token, was bedeutet, dass das Modell hauptsächlich las und nicht schrieb. Die anfängliche Hypothese war ein langer Dialogverlauf, aber der tatsächliche problematische Dialog hatte nur zwei Nachrichten mit insgesamt 530 Zeichen. Messungen ergaben, dass der Kontext pro Schritt 13.900 Token betrug, und bei 9 Schritten erreichte die Gesamtsumme etwa 120.000 Token; der Overhead multiplizierte sich mit der Anzahl der Schritte in der Agentenschleife. Zusätzlich reserviert der Anbieter die Kosten für den ungünstigsten Fall, indem max_tokens hoch angesetzt wird, was selbst bei ausreichendem Guthaben zu HTTP-402-Fehlern führt. Die Lösung bestand darin, vorab geladenen Kontext zu On-Demand-Tools zu verschieben, ein Zeichenbudget mit Prioritäten und expliziten Kürzungsmarkierungen zu verwenden und Geschwindigkeitserwartungen transparent zu machen. Der Artikel betont, dass Kontext niemals stillschweigend vor dem Modell verborgen werden sollte und dass Optimierungen an konkreten Fällen verifiziert werden sollten, da sie fast einen Fall optimiert hätten, in dem der Verlauf irrelevant war.
Quelle: Habr — хаб ML —
Original
