エージェント開発の真のリーダーは?意外な結果
Anthropic
DeepSeek
OpenAI
Google/DeepMind
Alibaba/Qwen
ガバナンススタックの下でエージェントコーディングを使用した単一開発者による2週間の本番実験では、30,993リクエストで88億トークンを消費しました。コスト分析により、AnthropicのモデルとDeepSeekの間には72倍の価格差があり、これは93%のKVキャッシュ圧縮技術によるもので、ガバナンスを手頃な価格にするにはDeepSeekのアーキテクチャが必要であることが明らかになりました。
この記事は、2026年6月に行われた2週間の生産実験について報告しています。この実験では、1人の開発者がガバナンススタックを備えたエージェント型コーディングツールを使用し、30,993件のリクエストで88.2億トークンを消費し、キャッシュヒット率は99.38%でした。ガバナンス(ポリシー、スキル、レビュープロンプト)によるコンテキストオーバーヘッドは、呼び出しごとに70,000〜90,000トークンの範囲です。コストはモデルによって大きく異なります。AnthropicのSonnet 4.6は、現実的な92%のキャッシュヒット率で同じワークロードを処理する場合、4,770ドルかかりますが、DeepSeek V4 Proのコストはわずか66.17ドルで、72倍の差があります。この差は、DeepSeekのMulti-Head Latent Attention(MLA)に起因しています。MLAはKVキャッシュを93.3%圧縮し、キャッシュ読み取りをほぼ無料にし、キャッシュを3FSを介してコモディティSSD上で数日間保持できるようにします。一方、Anthropic、OpenAI、GoogleはGQA(Grouped Query Attention)またはMHA(Multi-Head Attention)を使用しており、キャッシュはHBMの制限により1時間以内に失効します。また、この記事は、Uber、Microsoft、Amazon、Pinterest、および名前の明かされていない企業でのインシデントを引用し、制御されていないエージェント使用によるコストの暴走を示しています。そして、DeepSeekのアーキテクチャ上の選択により、ガバナンスが経済的に実現可能になる一方で、より高価な代替手段ではチームが安全対策を削減せざるを得なくなる、と主張しています。
出典: Habr — хаб ИИ —
原文
