跳转到内容
主站 新闻 控制台

你的智能体究竟需要多少内存?

· Hugging Face
教程模型卡

在我们的上一篇文章中,我们将 ALTK-Evolve 与 ACE 进行了比较,并展示了如何交付智能体的自蒸馏指导原则——是每个任务检索几条,还是注入完整集合——会同时影响准确率和成本。本文进一步探讨此前更基础的问题:应该提供多少指导原则?

为智能体配备智能体记忆听起来很简单:从过去的工作中提炼经验,将其放回上下文中,更多经验应该意味着更好的性能。但事情并不总是如此。当我们将评估扩展到 8 个模型——从 30B 的稠密模型到前沿闭源系统——有一个发现尤为突出:

智能体记忆不是一个可以直接开启的功能,而是需要根据模型进行剂量校准的能力。

TL;DR

  • ALTK-Evolve 让智能体能够从自身过去的轨迹中学习:提炼可复用的指导原则,并在推理时将其注入,无需更新模型权重,也无需人工标注。

  • **合适的剂量因模型层级而异:**具有性能提升空间的强模型希望获得完整的指导原则集合;较弱的模型在使用精简核心集合并结合按任务检索时表现最佳;已经接近饱和的模型则没有显示出可测量的收益。

  • **精选检索既可能是准确率最高的方案,也可能是成本最低的方案:**gpt-oss-120b 的任务完成率提升了 16.1 个百分点,而 token 数仅增加 5%;同时,提示缓存(prompt caching)也让完整指导原则集合在生产环境中仍然具备可承受的成本。

核心洞察:剂量取决于能力

并非所有模型都能从相同数量的记忆中受益。在覆盖不同能力水平的 8 个模型中,我们观察到三种反复出现的模式:

  • 具有性能提升空间的强模型希望获得完整的指导原则集合——包括每一条指导原则,以及针对罕见边界情况的经验教训。它们具备吸收并应用全部信息的能力。在获得完整的自挖掘指导原则集合后,DeepSeek-V3.2(671B MoE)的任务完成率提升了 9.5 个百分点。

  • **更小或更弱的模型会被大型指导原则集合淹没。**对于这类模型,最有效的方式是使用一个紧凑且高置信度的核心集合,再加上按任务检索的少量相关指导原则。gpt-oss-120b(117B MoE)采用这种选择性方案后提升了 16.1 个百分点;相比之下,完整指导原则集合带来的提升更小,token 成本却高出约 50%。

  • **已经饱和的模型没有显示出可测量的收益。**我们将其称为“饱和模式”——这个标签描述的是我们的观察结果,而非已经得到证明的原因。模型可能已经接近这些任务的性能上限,指导原则可能没有覆盖它剩余的失败案例,也可能是模型没有有效应用这些指导信息。在我们的实验中,GLM-5(745B MoE)属于这一模式。

*决定模型属于哪种模式的并不只是参数量。*基准测试中的性能提升空间、上下文窗口大小、架构、指导原则质量以及任务分布似乎都会影响模型最终落入哪种模式,而区分这些因素仍是持续进行中的工作。无论具体原因如何,实际结论都成立:合适的记忆剂量取决于模型,而且我们可以对其进行校准。

学习发生在模型周围,而不是模型内部

这里的“记忆”并不是重放过去的对话记录,而是一组指导原则——从智能体过去的轨迹中提炼出的有效策略、需要避免的错误以及边界情况。整个流程很直接:

  • 智能体尝试完成任务并生成轨迹。

  • ALTK-Evolve 从成功和失败的运行结果中提取行为指导原则。

  • 系统将这些指导原则整合为可复用的集合。

  • 在推理时,智能体接收完整的指导原则集合,或其中与任务相关的部分。

模型权重不会被更新。该学习循环改变的是智能体可以获得的指导信息,而不是底层模型本身——这正是它易于采用,并且能够跨我们测试的 8 个模型移植的原因。

跨越不同能力水平的结果

我们在 AppWorld 上进行了评估——其中包含 585 个多步骤任务(168 个 test_normal 任务和 417 个 test_challenge 任务),覆盖 9 个模拟应用(包括日历、消息、支付等)。任务通过两种方式评分:智能体是否完整完成每项任务(TGC——任务目标完成率,Task Goal Completion),以及某个场景的所有变体是否都通过(SGC——场景目标完成率,Scenario Goal Completion;这是一项更严格的“全有或全无”指标)。完整定义见附录。

我们比较的三种配置

由于任何记忆研究中最容易令人困惑的部分,是上下文窗口中究竟包含了什么,因此我们先明确介绍这三种配置。

两种记忆配置都使用同一组指导原则。这组指导原则通过上述流程从 AppWorld 的训练集中一次性挖掘得到。两者之间唯一的区别在于如何交付这一组指导原则——完整指导原则集合在每个 ReAct 步骤中注入全部内容,而精选检索则交付其中经过选择的子集。指导原则的生成方式并未改变,也没有任何测试集数据被用于构建指导原则集合。

配置智能体上下文中的内容
基线无记忆——使用模型开箱即用的状态。
完整指导原则集合每条挖掘出的指导原则都在每个 ReAct 步骤中注入。
精选检索从同一组指导原则中选取固定的高置信度核心集合,再为每个任务检索少量相关指导原则(固定部分 + 可变部分)。

模型能够挖掘出的指导原则数量取决于自身能力,因此我们按照策略——“完整指导原则集合”与“精选检索”——来报告配置,而不是使用原始数量,因为不同模型之间的原始数量并不可比。

三种模式一览

以下是 8 模型评估中的代表性模型,指标为 test_normal 上的任务完成率(TGC):

图片

图 1。观察到的三种模式中的代表性模型。柱状图展示了 AppWorld test_normal 上基线配置与最佳记忆配置的 TGC;横轴从 40% 开始,以便更清晰地呈现差异。单独查看 TGC 会低估 SGC 更大的增益——详见下表中的 SGC 列。

图中绘制的是 TGC,以保证可读性;下表补充了更严格的 SGC 指标,其中增益通常更大:

模型模式基线 TGC / SGC最佳记忆配置 TGC / SGC最佳配置Δ TGCΔ SGC
gpt-oss-120b(117B MoE)弱 / 选择性39.9 / 21.456.0 / 37.5精选检索……