桃子桃子快讯
返回首页
工具

Coalent 发布 v0.6:带来源失效追踪的 LLM 语义缓存层

面向 RAG 与智能体的语义缓存工具 Coalent 发布 v0.6,新增池化读取路径与 MCP 集成,并附带 605…

2026.08.18 · 周二3 分钟阅读

Coalent 是一个面向 RAG 与 AI 智能体的语义缓存中间件,近日发布 v0.6 版本。该工具的核心思路是把对文档的理解结果按查询语义缓存起来,并在底层文档发生变化时按来源精确失效,避免传统 chunk 缓存在多跳问答中出现的「静默过期」问题。

核心机制

Coalent 强调三点设计取舍:

  • 抽取式理解而非分块:缓存单元是 LLM 从源文档中抽取的、与查询无关的「原子 claim」,每个 claim 附带原始证据,多个后续查询可以复用同一单元。
  • 跨查询、跨智能体、跨文档复用:以查询语义而非文本作为缓存键,不同智能体再次提问也能命中;并支持跨单元召回,把分散在不同文档中的 claim 拼起来回答多跳问题,过程中不增加 LLM 调用。
  • 按来源失效:每个缓存单元记录自己引用的源文档;只要其中一个源发生变化,只有真正依赖该源的单元会被标脏并按需重建,避免整图重建。

工具定位在「检索层之上」,可与任意检索器(向量库、混合检索、GraphRAG、API 工具)组合,并非替代检索器。

v0.6 新增能力

本次更新主要带来两个特性:

  • 池化读取路径(read_path="pool"):每次读取直接返回一个按 token 预算打包、全局排序后的新鲜 claim 池,而非路由到单个缓存单元。
  • MCP 服务端与 LangChain 适配:新增 coalent-mcp,可在 Claude Code、Cursor 等 MCP 客户端中一行接入;langchain-coalent 把既有 LangChain 栈变成缓存底层。两项均为叠加式集成,默认行为不变。

此外,v0.6 还附带一个默认关闭的「行为栈」(residual spans → refusal fallback → append-only repair → query keys),在同一存储上测得拒答下降约 33%,准确率提升约 3.1 个百分点。

基准测试结果

作者在 605 道新闻类问答基准上做了对照测试(严格判分):

  • 默认 v0.5 路径:精度 0.711 @ 1,311 context tokens(等价朴素 top-9 检索)。
  • 池化读取路径(v0.6):精度 0.731 @ 981 tokens,在同等精度下相比朴素检索最优测点(top-12:0.731 @ 1,729)减少约 43% 的 token。
  • 池化路径下的归因头:使用内置占位头时精度 0.68,替换为三行 pool_header 可调用后提升至 0.73。

数据为作者自报,未见第三方独立复现。

集成与上手

核心包通过 pip install coalent 安装,零强制依赖。默认提供 StubSynthesizer,无需 API key 即可在十秒内跑通冷启动 / 命中 / 失效重建的完整回路。接入真实模型时,可替换为 LLMSynthesizer + OpenAIProvider,并通过 OpenAIEmbedder 按语义匹配查询;多跳场景可调高 recall_threshold 以触发跨单元召回。

信源