Agent 记忆赛道首份统考放榜:MemoraX 七项全能第一
AML「记忆之巅」首期榜单发布,深圳忆纪元 MemoraX 以 58 分位列总榜第一并拿下全部七项能力第一。
8 月 12 日,由海内外近 30 所研究机构联合发起的 AML(Agent Memory Leaderboard,中文名「记忆之巅排行榜」)正式公布首期结果。该榜单上线以来官方站点点击量突破 20 万次,吸引 136 个团队提交注册;放榜当日项目主页跻身 Hugging Face 实时趋势榜前十。首期总榜冠军为 MemoraX,得分 58.0,并在全部七项能力维度上排名第一。
榜单要解决什么问题
过去评价一个 Agent「记性好不好」长期缺乏统一标准:各家采用的数据、答题模型、Prompt 和评分规则各不相同,分数差异既可能来自记忆系统本身,也可能来自底层大模型能力的差异,难以横向比较。
AML 的设计思路是把评测链路统一起来:参评系统只负责两件事——把历史信息记下来(Add),在问题到来时找回来(Search);拿到记忆之后的答案组织与评分,全部由平台用同一套模型与标准完成。考试科目方面,文本记忆覆盖事实召回、多跳推理、时间与事件、记忆治理、个性化、上下文执行、安全与隐私七个方向,代码记忆则考察系统复用历史调试和开发经验的能力。
首期结果:榜前各有绝活
商业榜单中,排名第二、第九的框架在事实召回、多跳推理、时间推理和记忆治理上表现强劲,但规则与工作流执行能力是其共同短板;季军框架的个性化能力达 57 分,核心优势在于对用户意图与偏好的理解,但在时间推理与安全隐私维度偏弱。
MemoraX 以 58.0 分锁定总榜第一,且在七项能力维度上全部排名第一。公开信息显示,运营方为深圳忆纪元科技有限公司,成立不到半年,5 个月内已完成三轮大额融资。
路线之争刚刚开始
根据公开资料,MemoraX 走的是「内生记忆」与 Agentic RL(智能体强化学习)路线:把「什么值得记、什么时候更新、什么时候调用」交给模型自主学习,而非依赖人工规则与提示词。在 AML 之前,该路线已在多个基准上获得点状验证:
- 南京大学与上海 AI Lab 联合发布的 LoCoMo-Refined 基准上取得 82.65 分,领先第二名 30%;
- 与牛津大学联合开源的剧本记忆基准 ScriptMem 上正确率 60.3%,领先第二名 40%;
- 编码领域 SWE-context-bench 上任务解决率 45%,领先第二名 50%。
与之相对的「外挂式」记忆库方案则胜在成熟、合规、即插即用。两类路线一期榜单均未能定论终局。
标准化评测的下一步
文章引用技术社区观察者的类比,将 AML 类比为记忆领域的「ImageNet 时刻」——价值不在于选出冠军,而在于提供统一标尺。商业化层面,Mem0 的 API 调用量一年内增长 5 倍,验证了「记忆即服务」的付费意愿;企业侧对私有化部署、多租户隔离、权限审计的要求,又把竞争拉向工程厚度的比拼。
记忆系统真正的考场仍在生产环境:长期运行稳定性、成本可控性、企业级安全与合规要求,都不是一次集中评测能够回答的。AML 首期榜单至少让不同技术路线第一次站在了相同条件下被观察和比较,第二期放榜时排名是否会生变,将是后续值得关注的信号。
