Wie leidt echt in agentische ontwikkeling? Het is niet wie je denkt
Anthropic
DeepSeek
OpenAI
Google/DeepMind
Alibaba/Qwen
Een twee weken durend productie-experiment door een enkele ontwikkelaar met behulp van agentisch coderen onder een governance-stack verbruikte 8,8 miljard tokens over 30.993 verzoeken. De kosten onthullen een 72-voudig prijsverschil tussen de modellen van Anthropic en DeepSeek, gedreven door een 93% KV-cache compressietechnologie, waardoor governance alleen betaalbaar is met de architectuur van DeepSeek.
Het artikel meldt dat een productie-experiment van twee weken in juni 2026, waarbij één ontwikkelaar agentische codeertools met een governance-stack gebruikte, 8,82 miljard tokens verbruikte in 30.993 verzoeken, met 99,38% cache-hits. De contextoverhead voor governance (beleid, vaardigheden, review-prompts) varieert van 70.000 tot 90.000 tokens per aanroep. De kosten variëren sterk per model: Anthropic's Sonnet 4.6 zou $4.770 kosten voor dezelfde workload met een realistische cache-hit van 92%, terwijl DeepSeek V4 Pro slechts $66,17 kostte, een verschil van 72 keer. Deze kloof komt voort uit DeepSeek's Multi-Head Latent Attention (MLA), die de KV-cache met 93,3% comprimeert, waardoor cache-uitlezingen bijna gratis zijn en caches dagenlang kunnen blijven bestaan op goedkope SSD's via 3FS, terwijl Anthropic, OpenAI en Google GQA/MHA gebruiken met caches die binnen een uur vervallen vanwege HBM-limieten. Het artikel citeert ook incidenten bij Uber, Microsoft, Amazon, Pinterest en een naamloos bedrijf, die tonen dat ongecontroleerd agentgebruik tot hoge kosten leidt, en betoogt dat DeepSeek's architecturale keuze governance economisch haalbaar maakt, in tegenstelling tot duurdere alternatieven die teams dwingen om veiligheidsmaatregelen te schrappen.
Bron: Habr — хаб ИИ —
origineel
