单次智能体步骤消耗12万令牌:它们去了哪里,我们如何修复
自主智能体在循环执行每个步骤时反复发送完整上下文,导致令牌消耗远超预期。Uma Computer发现真正原因并非对话历史,而是系统指令、工具模式定义和记忆的多重开销叠加。文章提出三项优化:将大体积内容转移至按需调用工具、改用带显式截断标记的字符预算机制,以及明确速度预期以提升透明度。
Uma Computer是一款能够执行网络搜索、媒体生成和视频剪辑等任务的自主代理,其开发人员调查了为何一个用户请求消耗了38个积分,而非预期的三分之一。账单显示使用了119,208个提示词令牌和仅1,018个完成令牌,这意味着模型主要在读取而非写作。最初的假设是对话历史过长,但实际有问题的对话只有两条消息,共530个字符。测量显示,每一步的上下文为13,900个令牌,9步之后总计达到约120,000个令牌;开销乘以代理循环中的步骤数。此外,提供商在设置max_tokens较高时保留了最坏情况下的成本,导致即使余额充足也出现HTTP 402错误。修复方案包括将预加载的上下文移至按需工具,使用带有优先级和显式截断标记的字符预算,以及使速度预期透明化。文章强调,上下文绝不应被静默地从模型中隐藏,优化应在具体案例上进行验证,因为他们差点针对一个历史记录无关紧要的案例进行优化。
来源: Habr — хаб ML —
原文
