Waarom neurale netwerken tokens verorberen: wat er gebeurt bij lange chats en hoe u kosten kunt besparen
Anthropic
SYNTX.AI
Lange AI-gesprekken met enorme contextvensters verhogen de tokengerelateerde kosten en kunnen de prestaties van modellen aantasten. Een Reddit-gebruiker meldde dat hij meer dan een miljard invoertokens met Claude verbruikte, terwijl iemand anders ongeveer $6000 opstapelde door een onbeheerde AI-agent. Studies zoals 'Context Rot' tonen aan dat de prestaties afnemen naarmate de context groeit, en experts raden aan om taken op te splitsen, de geschiedenis te comprimeren en prompt-caching te gebruiken om te bezuinigen.
Het artikel bespreekt waarom AI-modellen excessief tokens verbruiken in lange chats en hoe de kosten kunnen worden verlaagd. Het citeert anekdotes van Reddit: een gebruiker verbrandde 1,156 miljard invoertokens met Claude, een ander vergat een Claude Code-agent te stoppen die elke 30 minuten pull-requests controleerde gedurende 26 uur, wat neerkwam op 46 runs en ongeveer 6000 dollar kostte. De technische reden voor de hoge kosten is dat elk nieuw verzoek de volledige opgebouwde context bevat, die kan oplopen tot 800 duizend tokens. Anthropic waarschuwt in hun documentatie dat de kosten stijgen met de contextgrootte en beveelt aan om de geschiedenis te wissen of compactie te gebruiken. Onderzoek van Chroma ('Context Rot') en een studie uit 2026 ('Diagnosing and Mitigating Context Rot') tonen aan dat de prestaties verslechteren bij langere invoer, zelfs voordat de contextwindowlimiet is bereikt, vooral met afleidende informatie. Prompt-caching verlaagt alleen de kosten voor herhaalde prefixen, niet de problemen van onnodige context. Voor AI-agenten zijn de kosten verborgen omdat ze autonoom veel tooloperaties uitvoeren. Praktische tips zijn onder meer het opsplitsen van onafhankelijke taken, het gebruiken van '/clear' en '/compact' in Claude Code, het geven van alleen relevante documentsecties, het cachen van stabiele instructies en het kiezen van het juiste modelniveau (Sonnet voor coderen, Opus voor complex redeneren, Haiku voor eenvoudige subagenttaken). De auteur promoot ook SYNTX.AI's LLM Studio, die meer dan 100 AI-modellen biedt en de mogelijkheid om binnen een dialoog van model te wisselen, met promotiecode CTRLAI voor 20% korting. Het artikel concludeert dat prompt-engineering nu ook het weggooien van onnodige informatie moet omvatten.
Bron: Habr — хаб ИИ —
origineel
