将路由器嵌入你的智能体系统听起来像是轻松取胜。把简单请求发送给更便宜的模型,把昂贵的模型留给更难的任务,或者按专长路由——代码交给 Claude,多模态交给 Gemini,等等。分类器或启发式规则来做决定,成本下降,性能保持不变。完成。
但事实并非如此。大多数路由系统都假设模型选择是一个分类问题。根据我们在智能体系统中构建路由的经验,表面上看似模型选择问题的东西,很快就会变成系统优化问题。有三个维度让这件事出乎意料地困难。
1. 成本不只是模型定价
我们原本以为 GPT-4.1 会比 Claude Sonnet 4.6 更便宜。结果并不是。
在 AppWorld Test Challenge 的 417 个任务上,使用同一个 CodeAct 智能体时,Sonnet 的总成本为 79 美元(每任务 0.19 美元),而 GPT-4.1 为 155 美元(每任务 0.37 美元)——几乎高出一倍。单从纸面价格看,这完全说不通。GPT-4.1 的输入和输出 token 定价都更低,而且 Sonnet 完成同样任务所需的推理步骤大约是其三倍。仅按标价来看,GPT-4.1 本应轻松胜出。
原因是什么?缓存——这是大多数路由讨论完全忽略的东西。
智能体工作负载往往会在多个步骤之间复用大量上下文。当缓存命中率很高时,有效输入成本会大幅下降。Sonnet 更低的缓存读取价格使它在这种模式下受益更大,足以抵消其更高的基础定价和更长的推理轨迹。
结论是:实际成本取决于模型、工作负载和服务基础设施之间的相互作用。只看定价表的路由器,其实是在用错误的指标做优化。
2. 复杂度不只是任务难度
一种常见的路由策略是估计任务有多难,然后把更难的任务送给更强的模型。这个思路很直观,但有两个问题。
首先,任务难度在路由时往往是不可见的。像“总结这份合同”这样的请求看起来很简单,但在完成之前可能会触发检索、合规检查、工具调用,以及多轮润色。与此同时,一个高度技术化的提示词,可能会被一个更小但更专门的模型高效处理。你通常要到执行开始之后,才知道任务到底有多难。
其次,即使你能完美估计难度,它也只是众多信号中的一个。在生产环境中,路由器需要同时平衡成本、延迟、模型专长和可靠性。企业部署还会叠加更多约束:合规要求、数据驻留规则、隐私限制、已批准的模型列表。一个理想上应该交给某个模型的任务,可能因为治理要求必须交给别的模型——而路由器必须优雅地处理这种情况。
路由器解决的不是一个问题。它们是在同时不断权衡成本、质量、延迟、合规和可靠性。
3. 延迟不只是模型速度
人们很容易只从模型大小来理解延迟——大模型更慢,小模型更快。但用户实际感受到的体验远不止这些。
路由本身就会带来开销。基础设施因素——模型运行在哪种硬件上、缓存是否预热、端点有多忙——往往主导端到端响应时间。即使理论上更快的模型,如果服务条件不合适,最终体验也可能更慢。
此外,还有路由粒度的问题。每个任务只路由一次,开销最小。但如果在每一步都路由——这样你就能在执行过程中更灵活地调整——那就意味着每增加一个决策点,都会引入延迟和运维复杂性。
忽略服务系统的路由器,是在针对错误的现实做优化。
那我们是怎么处理的?
这些经验教训塑造了我们构建路由器的方式。关键转变是:我们不再把路由视为分类问题,而是把它视为优化问题。与其问“哪个模型最适合这个任务?”,我们的算法会同时在成本、质量和延迟之间进行优化——而且足够轻量,不会让自己变成瓶颈。
下图展示了我们在 AppWorld Test Challenge 上使用 CodeAct 智能体的结果。每个蓝色方块代表我们路由器的不同配置,勾勒出一条成本-准确率前沿。重要的不是某一个单点,而是路由器能提供一组可选运行点,供你根据更看重成本、延迟还是准确率来选择。配置 1(以延迟优化为目标)达到了 84% 的准确率,成本 93 美元,耗时 83 秒——与仅运行 Opus 相比,成本降低 21%,延迟降低 9%,而准确率只下降 4%。配置 2 还能进一步压低成本。
注意,标准的基于难度的路由器(青绿色菱形)落在相近的准确率区间,但成本更高——它并不像基于优化的方法那样探索了完整的权衡空间。而且由于优化本身非常轻量(每个任务大约 6 毫秒、2 KB 内存),路由器并不会变成我们前面警告过的瓶颈。
更大的图景
这项工作给我们的启示是:路由真正要做的并不是选择模型,而是优化系统。模型只是一个变量——而且很重要——但它只是缓存行为、基础设施状态、合规约束和工作负载模式等众多因素之一。
当路由工作得很好时,原因通常不是它为某个任务找到了“最佳”模型,而是它为整个系统找到了最佳运行点。这比分类更难,但也更值得解决。
我们会在后续文章中分享更多关于我们方法的技术细节。与此同时,如果你也在自己的智能体系统中构建路由,欢迎告诉我们你正在权衡哪些取舍。
致谢
这篇文章受到了与多位同事交流的启发,他们深思熟虑的问题、反馈和见解帮助我们不断完善思路。
