智能体的记忆不是开关,而是剂量:HF 跨 8 模型评测给出三条规律
HF 博客以 ALTK-Evolve 为例测试 8 个模型,发现 Agent 记忆的最佳注入量因模型能力而异。
Hugging Face 博客近日发表了一篇关于「智能体记忆该给多少」的研究文章,作者团队用自家提出的 ALTK-Evolve 方案,在 8 个不同体量的模型上系统比较了「全量注入」与「按需检索」两种记忆策略。结果显示,Agent 的记忆并非「开就比关强」,而是需要按模型能力精确调节剂量。
ALTK-Evolve 的工作机制
ALTK-Evolve 是一种围绕模型外部运行的「记忆学习回路」,核心思路是不动模型权重,而是从 Agent 自身的过往轨迹中提炼可复用的策略指南,并在推理时回灌到上下文里。具体流程分四步:
- Agent 执行任务,产出完整轨迹;
- 系统同时从成功与失败轨迹中抽取行为准则;
- 将零散准则整合为一份可复用的「指南集」;
- 推理时,要么全量注入,要么按任务检索相关子集。
由于全程不更新参数、不依赖人工标注,这种方案天然具备跨模型可移植性,团队也据此在 8 个模型上完成了横向评测。
评测设置:AppWorld 上的三种记忆配置
评测基准是 AppWorld,包含 585 个多步骤任务(test_normal 168 个、test_challenge 417 个),覆盖 9 个模拟应用(如日历、消息、支付等)。评分采用两个指标:TGC(任务目标完成率)和更严格的 SGC(场景目标完成率,要求任务所有变体全部通过)。
文章把记忆配置明确定义为三种,方便横向对比:
- Baseline:原模型,无任何记忆注入;
- Full guideline set:每次 ReAct 步骤都注入全部已提炼的指南;
- Curated retrieval:在同一份指南集基础上,仅注入一个固定的高置信度「核心集」,再叠加少量按任务检索出的相关条目。
值得注意的是,两种记忆配置使用的是同一份指南,且仅由 AppWorld 的训练集轨迹提炼而成,测试集数据未参与构建,确保了评测的公平性。
三条跨模型规律
跨 8 个模型的评测提炼出三种典型模式:
- 强模型且仍有提升空间时,全量注入效果最佳。DeepSeek-V3.2(671B MoE)使用完整指南集后,TGC 提升约 +9.5 个百分点。
- 较弱或较小模型会被大量指南「淹没」,应改用精选核心 + 按任务检索。gpt-oss-120b(117B MoE)采用此策略后 TGC 提升 +16.1pp,同时只多花约 +5% 的 token;相比之下,全量注入收益更低且多消耗约 50% token。
- 已经接近能力上限的「饱和型」模型加入记忆后无明显增益。GLM-5(745B MoE)即属此类,作者也指出这可能源于「已在这些任务上触顶」「指南未覆盖其剩余失败」「未能有效应用指南」等多种原因,仍待后续分离验证。
作者特别强调,决定一个模型落在哪类模式并非单纯看参数规模,benchmark 余量、上下文窗口、架构、指南质量与任务分布都可能塑造其表现,相关解耦工作仍在进行。
实用含义
文章给出的工程结论非常直接:记忆是剂量问题,不是开关问题。强模型要喂全,弱模型要精选,饱和模型不必硬塞。配合 prompt caching,即便全量注入方案在生产环境中的成本也可控。这意味着落地 Agent 时,与其追求「越多越好」的记忆堆叠,不如先诊断模型当前所处的模式,再选择匹配的记忆注入策略。
