AI智能体:并行化工作,而非并行化错误
OpenAI
Anthropic
一项由包括Anthropic在内的研究人员进行的研究引入了名为Horizon的基准测试,并分析了超过3100条智能体轨迹。结果显示,在任务复杂度超过一定阈值后,AI智能体的性能可能突然崩溃,其中72.5%的失败归因于流程相关风险。Anthropic建议拆分独立项目,而非项目阶段。
研究人员开发了一个名为Horizon的基准测试,并对超过3100条agent轨迹进行了分析,涉及环境包括网络、操作系统、数据库以及具身场景。实验中使用的agent基于OpenAI和Anthropic的模型。研究结果显示,随着任务延长,性能并非逐渐下降,而是可能保持稳定,随后在超过某个阈值时突然崩溃。他们识别出七大类失败,归为两个大类:72.5%的失败与过程相关风险有关,27.5%与agent设计风险有关。Anthropic强调了一种叫做“上下文污染”的现象,即积累的中间信息杂乱地堆积在agent的上下文中,损害其判断力。研究建议,将任务拆分为独立的子任务,由各自独立的agent处理,这种方式有效;而像设计、实现和测试这样共享过多上下文的阶段拆分,则会导致信息损失,类似于传话游戏。对于高管来说,四个关键问题是:谁做出的决策、基于什么信息、付出了什么代价,以及某个失败的步骤能否独立重放。如果无法重放,事件就得从头再来,而不当的拆分可能会比单个agent花费多3到10倍的成本。
来源: Le Monde Informatique — IA —
原文
