大学生团队湖川宣称在 AI 长期记忆基准上领先
天津城建大学学生团队湖川自研 R-Memory 系统,在 LoCoMo 与 LongMemEval 两项基准宣称取得领先…
一支由天津城建大学学生为主体、约 40 人规模、跨艺术、计算机、投资学等专业组成的「湖川」团队,在未完成公司注册、未发一分钱薪酬的情况下,用 10 个月时间自研 260 万行核心代码,开发出长期记忆系统 R-Memory,并在两项公开记忆基准上宣称取得领先成绩。该团队计划于 2026 年 8 月完成「天津湖川智能技术有限责任公司」的工商登记。
团队背景:从校园湖畔走出的多学科小组
湖川 CEO 李一坤介绍,团队缘起于校园湖边的一次构思,目前专家委员会包含中科院心理学教授张雅明博士(荣誉主席)、巴塞罗那大学语言学博士时若洋(首席科学家)、港中文博士张逸梅(心理交互)以及德国马格德堡大学神经科学博士郑蕾(科研统筹),首席架构师 Albert 负责将工程实现与各学科理论对齐。
技术路径:以记忆结构而非模型参数取胜
首席科学家时若洋将长期记忆定位为「模型之外的下一层基础设施」,目标在于让 AI 跨会话记住上下文、持续推进任务。R-Memory 的设计并非来自单一工程视角,而是融合了心理学、认知科学、语言学与哲学:
- 底层借鉴 Conway 的自传体记忆理论,区分情境记忆与语义记忆,搭建「具体事件→概括性事件→人生阶段」的三层自我结构。
- 引入第一人称视角提取,让 AI「湖伴」生成专属自传体记忆,而非仅维护用户画像;多人交互时按主语拆分存储。
- 提出「三态设计」认知边界机制,把检索结果标注为确定态、摇摆态、未知态,分别对应直接断言、追问求证与明确拒答三种策略,用以缓解连续向量空间中「不知道」难以界定的工程难题。
系统架构与基准成绩
湖川公开的架构要点包括:HAPP 超异步架构(基于 WebSocket 全双工、事件驱动、多模型通道)、记忆引擎的「十维四轴」结构(十维覆盖上下文、事实、观点、偏好、观察、经验、时间性、情绪、关系、成长;四轴为时间、重要性、证据、状态)以及「记忆带 × 记忆链」双正交检索配合 11 层分层注入。官方称千轮对话召回率 98.9%,检索延迟控制在 100 毫秒以内,Token 消耗降低 50%。
在基准测试层面,湖川公布的成绩如下:
- LoCoMo(Backboard 商业记忆基准):92.79%(1429/1540),高于官方自报的 90.00、Memobase 的 75.78、Zep 的 75.14。
- LongMemEval(ICLR 2025,500 题):88.2%,宣称超过此前商业系统的最好成绩——ChatGPT 57.7% 与 Coze 33.0%。
- 切换到较小模型(如 deepseek-v4-flash)后仍保持 87.01% 准确率,团队以此说明「记忆这件事是结构在解决,不是模型在解决」。
团队表示正在开发挑战与验证接口并筹备论文,试图将成绩向独立检验开放。
伦理设计:把「不知道」做成系统信号
湖川将「三态设计」视为对 AI 幻觉的工程化回应——把不确定性纳入信号处理,而非任由模型自由生成。产品「湖伴」定位为「积极正能量的普通朋友」,不做心理治疗;当系统进入未知态且检测到可能涉及严重心理问题时,会引导用户寻求专业咨询。文中提到 2026 年 7 月《拟人化互动服务管理暂行办法》将施行,团队称已完成三重备案。
商业化现状与市场坐标
产品形态上,团队提供 API 接入、私有化部署和场景化封装三种模式,面向陪伴机器人、AI 玩具、家庭服务等硬件厂商。市场预测方面,文中援引数据:中国 AI 应用 TAM 约 1.3 万亿元,AI 个人助理与情感交互 SAM 约 200 亿元,首年 SOM 约 3000 万元,全球 Agentic AI 编排与记忆系统市场年复合增长率约 35.3%,国内 AI 用户已超 2.5 亿。
赛道并不冷清:忆纪元(MemoraX AI)半年内完成三轮融资并与华为云合作;丘脑智能(Thalamus AI)联合英伟达发布多模态长记忆基准;上海人工智能实验室也在探索 Agent 记忆的「重构而非回放」。相比之下,湖川目前仅完成首版 BP,公司主体尚未注册,处于早期筹备阶段,对外表示积极接受投融资以加速研发与市场化。
整体来看,文章以人物访谈与基准成绩为核心,把这支尚未正式注册的大学团队置于 AI 长期记忆基础设施这条 2026 年渐热的赛道上加以呈现;其成绩的独立可复现性、公司化进展与商业兑现路径,仍有待后续观察。
