想到 ACE?用更少 Token 我们也能做到
DeepSeek
OpenAI
这篇博客比较了两种代理记忆系统:ACE(代理上下文工程)和 ALTK-Evolve,两者都能在不更新权重的情况下,将代理的过往轨迹转化为可复用的经验。它们一致认为不对经验进行压缩,但在传递方式上有所不同:ACE 在每一步都注入全面的操作手册,而 ALTK-Evolve 则根据模型和任务来校准发送的准则数量。在 AppWorld 平台上,ALTK-Evolve 以更低的推理成本实现了相同甚至更高的准确率。
这篇博客介绍了ALTK-Evolve,并将其与ACE(Agentic Context Engineering)进行了比较。两者都是智能体记忆的形式,即将智能体的过往轨迹转化为可复用的经验,并在推理时注入,而不更新权重。两个系统在核心原则上一致,即不压缩经验:ACE使用一个全面且不断发展的操作手册,每条要点带有有用/有害计数器,而ALTK-Evolve将相似的经验合并成簇,并为每条指导方针维护支持计数,从不总结压缩存储。它们在记忆的构建和交付方式上有所不同:ACE通过生成器、反思器和策展器的循环,以增量更新和基于嵌入的去重方式,发展出单一的操作手册;而ALTK-Evolve则对近似重复进行聚类,支持使用支持度守恒的合并,并提取带有来源的、在子任务粒度上的类型化指导方针(策略、恢复、优化)。关键区别在于交付方式:ACE在每一步注入整个操作手册,而ALTK-Evolve则发送一个小的固定核心(由高支持度指导方针组成)加上针对特定任务的选取,或者如果模型能处理,则发送完整集合。在AppWorld基准测试中,使用相同的ReAct智能体,ALTK-Evolve以更少的令牌数取得了更高或相当的TGC和SGC分数:对于DeepSeek-V3.2,TGC为89.3对80.4,每个任务的令牌数为263K对634K;对于gpt-oss-120b,TGC为56.0对54.8,令牌数为116K对777K。准确率的提升来自于每个任务检索少量指导方针,而不是注入整个操作手册;按难度进行的分析显示,在困难任务上,经过策展的检索优于完整操作手册,而在较简单任务上,完整操作手册可能更有帮助,但差异很小。该博客指出,ACE自身的效率在于低成本构建上下文,而ALTK-Evolve的效率在于服务上下文;交付的校准是节省令牌数的关键。ALTK-Evolve库(包括提取、整合和检索流水线)以及完整的技术报告现已可用。
来源: Hugging Face blog —
原文
