智能体研究 🇺🇸 27.07.2026 02:04

模型路由:看似简单,直到遇到现实

OpenAIOpenAI AnthropicAnthropic
在AI模型之间进行路由不仅仅是分类问题,更是系统优化挑战。现实因素如缓存、基础设施、延迟和合规性占据主导地位,使得定价表和任务难度成为不可靠的指南。
AI模型之间的路由比想象中复杂得多。在AppWorld测试挑战中,使用CodeAct智能体对417个任务进行测试时,尽管GPT-4.1的每token定价更低,但其总成本为155美元(每任务0.37美元),而Claude Sonnet的总成本为79美元(每任务0.19美元)。造成这一差异的原因在于缓存:Sonnet更低的缓存读取定价使其在具有重复上下文使用的智能体工作负载中占据巨大优势。任务难度在路由时通常不可见,路由器必须同时平衡成本、质量、延迟、合规性和可靠性。延迟不仅取决于模型大小,还依赖于硬件和缓存状态等基础设施因素。作者构建了一个将路由视为优化问题而非分类问题的路由器,从而生成了成本-准确率前沿。配置1在成本93美元、延迟83秒的情况下实现了84%的准确率,相比单独运行Opus,成本降低21%,延迟降低9%,准确率仅下降4%。而基于难度的标准路由器(青色菱形)在准确率相似的情况下成本更高。该优化是轻量级的:每个任务仅需约6毫秒和2千字节内存。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻