小型 LLM 记忆层服务上线:基于知识图谱的 BYOK API
一款面向 LLM 应用的记忆与推理服务上线,采用 BYOK 与 Neo4j 图谱,提供 HTTP API。
一款定位为「LLM 大脑」的外部记忆与推理服务上线,主打通过 HTTP API 为大模型应用补齐长期记忆与上下文管理能力。该服务采用 BYOK(Bring Your Own Key)模式,用户自带模型密钥、Embedding 密钥以及 Neo4j 图数据库实例,服务侧仅承担「该记什么、该召回什么、该忽略什么」的检索与筛选逻辑。
核心思路:把记忆从 Prompt 里搬出来
产品方在发布文案中指出,大模型本身只是「嘴」——它对当前对话对象没有任何长期记忆,因此每个应用都要在每次会话中重新拼凑上下文,且效果往往受限。该服务试图把这一半补齐:通过一个持续累积的知识图谱,记录用户实际说过的内容,再针对当前消息做筛选与召回,只把相关部分交给模型。
这与目前业界常见的 RAG、向量检索方案方向一致——都是把「长期记忆」从 Prompt 里剥离出来,变成可独立管理的外部资源——但具体实现上选择了图数据库(Neo4j)而非纯向量库,强调实体、关系、情绪、条件等结构化信息的保留。
接入方式与数据结构
服务暴露两个核心 HTTP 接口:
- POST /v1/filter:完成一次「轮次」,包含检索、注意、筛选、生成四个步骤。
- POST /v1/ingest:将本轮学到的内容回写进图谱。
用户只需一个 Neo4j Aura 免费实例即可起步。写入图谱的内容被划分为多个类别:事实、长期指令、未结议题、实体与关系、情绪与状态。每条事实都附带来源和最近一次确认时间,方便后续做衰减与清理。
数据归属与计费
由于用户自带 Anthropic(或兼容)的推理密钥、Gemini 的 Embedding 密钥以及自管的 Neo4j,服务的运营方不承担推理、存储或召回费用,也不接触用户的静态数据。密钥层面,每个租户使用独立的 KMS 信封加密,密钥仅在使用瞬间解密。
产品目前处于早期阶段,免费开放,无信用卡、无试用倒计时。用户申请后会立即获得一次性展示的密钥。服务方表示将「持续免费直到值得收费」,但并未披露未来定价区间或 SLA 等级。
定位与局限
从公开描述看,这并非一个面向终端用户的产品,而是一个面向开发者的中间件层。它解决的是「如何让一个 LLM 应用记住用户」这一具体工程问题,而不是提供新的模型能力或评测基准。对于已经在自建记忆模块、或使用 LangChain、LlamaIndex 等框架内记忆组件的团队而言,该服务提供了一种更结构化的图谱替代方案;但缺乏与既有方案的横向对比数据,例如检索准确率、延迟、成本等关键指标尚未在发布材料中给出。
