智能体硬件与推理 🇷🇺 05.08.2026 17:02

代理式开发谁主沉浮?答案可能出乎意料

AnthropicAnthropic DeepSeekDeepSeek OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
一位独立开发者在治理栈下使用代理式编码进行为期两周的生产实验,共消耗88亿个令牌,涉及30,993次请求。成本显示Anthropic的模型与DeepSeek之间存在72倍的价格差距,这一差距源于93%的键值缓存压缩技术,使得只有DeepSeek的架构才能负担得起治理成本。
文章报道称,在2026年6月进行的一项为期两周的生产实验中,一名开发人员使用代理编码工具并搭配治理栈,共消耗了88.2亿个令牌,涉及30,993次请求,缓存命中率达99.38%。用于治理(策略、技能、审查提示)的上下文开销为每次调用70,000至90,000个令牌。不同模型的成本差异显著:对于相同的工作负载,以92%的实际缓存命中率计算,Anthropic的Sonnet 4.6将花费4,770美元,而DeepSeek V4 Pro仅需66.17美元,相差72倍。这一差距源于DeepSeek的多头潜在注意力(MLA)机制,该机制将KV缓存压缩了93.3%,使得缓存读取几乎免费,且缓存可通过3FS在商用固态硬盘上持久保存数天,而Anthropic、OpenAI和谷歌采用GQA/MHA,其缓存因高带宽内存(HBM)限制在一小时内失效。文章还引用了Uber、微软、亚马逊、Pinterest以及一家未具名企业的实例,展示了不受控制的代理使用导致的失控成本,并认为DeepSeek的架构选择使治理在经济上可行,而价格更高的替代方案则迫使团队削减安全措施。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻