智能体应用 🇷🇺 11.08.2026 16:02

神经网络为何吞噬令牌:长对话中的问题与降低成本之道

AnthropicAnthropic SYNTX.AISYNTX.AI
拥有巨大上下文窗口的长时间人工智能对话会增加令牌成本,并可能降低模型性能。一位Reddit用户报告称与Claude(克劳德)交互时消耗了超过十亿个输入令牌,而另一位用户则在无人看管的人工智能代理上花费了约六千美元。诸如“上下文腐烂”之类的研究表明,随着上下文增长,性能会下降,专家建议拆分任务、压缩历史记录以及使用提示缓存来节省成本。
这篇文章讨论了为什么AI模型在长时间对话中会消耗过多的token,以及如何降低成本。文中引用了Reddit上的轶事:一位用户使用Claude消耗了11.56亿个输入token,另一位用户忘记停止一个每30分钟检查一次拉取请求的Claude Code代理,持续26小时,共运行46次,花费约6000美元。高成本的技术原因在于,每次新请求都会包含整个累积的上下文,这个上下文可能增长到80万token。Anthropic在其文档中警告说,成本随上下文大小增加而上升,并建议清除历史记录或使用压缩功能。Chroma的研究(“Context Rot”)和2026年的一项研究(“Diagnosing and Mitigating Context Rot”)表明,随着输入变长,性能会下降,甚至在没有达到上下文窗口限制之前就会如此,尤其是在存在干扰信息的情况下。提示缓存只能降低重复前缀的成本,并不能解决不必要上下文的问题。对于AI代理来说,成本是隐藏的,因为它们自主执行大量工具操作。实用建议包括:拆分独立任务,在Claude Code中使用/clear和/compact命令,只提供相关的文档片段,缓存稳定的指令,以及选择合适的模型层级(Sonnet用于编码,Opus用于复杂推理,Haiku用于简单的子代理任务)。作者还推广了SYNTX.AI的LLM Studio,该平台提供超过100个AI模型,并允许在对话中切换模型,使用优惠码CTRLAI可享受20%的折扣。文章最后总结道,提示工程现在必须包括丢弃不必要的信息。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻