桃子桃子快讯
返回首页
工具

Agent Memory Leaderboard 首发评测结果:MemoraX 居榜首

智能体记忆系统首个公开榜单公布文本记忆评测,69 个记忆框架完成首轮评估,商用产品前三为 MemoraX、MemOS、N…

2026.08.13 · 周四2 分钟阅读

智能体记忆系统评测长期缺乏统一标准,不同框架之间的效果难以横向比较。Agent Memory Leaderboard(AML)近日发布了第一轮公开结果,聚焦"文本记忆(Text Memory)"方向,覆盖开源方法与商用产品两条赛道,是首个面向 AI 记忆系统的大规模公开榜单。

评测规模与赛道设置

首轮评测共吸引 136 支团队注册报名,最终有 69 个具有代表性的记忆框架(memory frameworks)完成了完整评估。榜单将参评对象分为两类:

  • 开源方法(Open-source Methods)
  • 商用产品(Commercial Products)

评测采用统一的系统边界划分:

  • 记忆系统侧:Add(写入)→ Search(检索)
  • 基准侧:Answer(作答)→ Eval(评估)

这种"两段切分"的设计,意在让记忆系统本身的能力与下游模型生成能力解耦,从而提高结果的可比性与可复现性。

商用产品榜:MemoraX 居首

商用产品赛道前三得分如下:

  • 第 1 名:MemoraX,得分 58.02
  • 第 2 名:MemOS,得分 45.89
  • 第 3 名:NTES-MEMORY-SMART,得分 44.21

榜单组织方表示,目标是把记忆系统变成一项可以像大模型基准那样被反复测量、横向比较的基础设施能力,缓解当前"各自宣称最优、缺乏共同标尺"的混乱局面。

待观察的局限

需要指出,本轮结果在 Hacker News 上的 Show HN 帖仅获 2 个点赞、0 条评论,社区反馈有限;同时,榜单尚未公布完整的开源方法排名、数据集构成、评估 prompt 与打分细则,仅披露了商用产品前三的得分。对于关心记忆系统的工程团队而言,可重点关注后续是否补充以下信息:

  • 评测所用数据集的规模与领域
  • 是否覆盖多轮对话与长上下文场景
  • 开源方法与商用产品在统一指标下的差距
  • 主办方背景与中立性说明

总体而言,Agent Memory Leaderboard 首轮结果为 AI 记忆系统领域补上了一块缺失的"度量衡",但要成为业内公认基准,仍需在数据透明度与方法论公开度上进一步补齐。

信源