AgentenModellen 🇷🇺 05.08.2026 13:03

Agent voor een Dollar: De Economie van de Hermes Agent plus DeepSeek V4 Flash-combinatie

DeepSeekDeepSeek
Een virale screenshot beweerde dat honderden miljoenen tokens werden verwerkt voor slechts iets meer dan een dollar, met behulp van de opensource Hermes Agent op DeepSeek V4 Flash. Dit nieuws verklaart de mechanismen achter zulke lage kosten, met de nadruk op automatische prefix-caching, en schetst wat de cache verbreekt en de beweringen van de leverancier.
Begin augustus circuleerde op X een screenshot van een dashboard met honderden miljoenen verwerkte tokens en een rekening van iets meer dan een dollar, naar verluidt afkomstig van het gebruik van de open Hermes Agent op het DeepSeek V4 Flash-model. De Hermes Agent, ontwikkeld door Nous Research onder de MIT-licentie, werkt met elke OpenAI-compatibele endpoint en beschikt over een gesloten leerlus, waarbij aangeleerde vaardigheden worden opgeslagen in Markdown-bestanden. DeepSeek V4 Flash, sinds 31 juli in openbare bèta, gebruikt dezelfde architectuur als de preview van april, maar met verbeterde agentische mogelijkheden na fine-tuning. De belangrijkste kostenbesparing komt niet van het lage basistarief, maar van automatische prefix-caching: herhaalde prompt-prefixen worden gefactureerd tegen een tarief dat tientallen keren lager ligt. De agentische lus past vrijwel perfect in deze mechaniek, aangezien elke aanroep hetzelfde systeemprompt en dezelfde geschiedenis opnieuw verzendt, met slechts enkele nieuwe regels toegevoegd. De besparingen vervallen echter als elementen in de promptkop wijzigen, zoals tijdstempels, sessie-identificatoren of dynamisch herschikte gereedschapslijsten. De leverancier claimt dat het kleinere model beter presteert dan het grotere previewmodel op agentische benchmarks, maar beveelt aan om de V4-Pro te gebruiken voor zware redeneertaken. Toeslagen voor piekuren zijn aangekondigd maar nog niet actief, en hybride routering met escalatie naar Pro reset de cache. Het artikel geeft prijstarieven, somt veelvoorkomende cache-brekers op, en adviseert over plannings- en operationele overwegingen zoals snelheidslimieten en beveiligingsperimeter.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws