桃子桃子快讯
返回首页
工具

AletheionAGI:面向 AI 智能体的证据绑定交付层

巴西团队发布 AletheionAGI,在检索器与 LLM 之间增加一道「证据桥」,号称可阻断无据回答。

2026.08.15 · 周六3 分钟阅读

巴西开发者团队在 Hacker News 发布 AletheionAGI,定位为「AI 智能体的接 grounding enforcement 层」。产品在现有 LLM 阅读器(reader)与业务数据之间插入一道「证据桥(Bridge)」,由其负责记忆检索、证据授权与声明校验,仅将可被证据支撑的回答交付给最终用户,未被支撑的内容则在交付前被拦截(fail-closed)。整套系统与具体阅读器解耦,用户可自带 API Key 接入任意 LLM。

核心能力与运行流程

官方将工作流拆为四步:

  • Write:规范化事件写入,由调用方掌握权威性。
  • Retrieve:ASM-CM、BM25 与向量检索并行为一条统一通道。
  • Authorize:通过命名空间(namespace)与标签约束候选证据。
  • Ground:未获证据支撑的输出在交付前被阻断。

系统强调「阅读器可失败,边界不可失败」的设计理念,将阅读器输出质量与桥接层(Bridge)安全性作为两项独立指标分别度量。

基准对比结果

在 979 条冻结的支持工单(MultiWOZ)上,官方给出了如下对比:

  • ASM-CM + Bridge:Recall@5 达 93.6%,诊断性回答得分 66.5%,每次向阅读器输入约 1.09K token。
  • 纯向量 RAG:Recall@5 70%,诊断得分 49.7%,输入约 2.04K token。
  • BM25:Recall@5 75.9%,诊断得分 56.8%,输入约 2.20K token。

官方同时给出自身安全指标:18/18 确定性控制项通过,45/45 次不安全交付被桥接层拦截;热查询平均延迟约 311 ms,单次查询预算固定为 2K 证据 token。

失败模式分类

官方披露了覆盖 22 类风险的威胁模型,分为四组:

  • 反馈完整性:涵盖错误反馈与撤回、恶意反馈、过期更正、自指验证循环等 6 项。
  • 语义检索:覆盖误激活、合法歧义、跨语言反馈迁移、隐式指代等 7 项。
  • 落地交付:包括证据正确但回答错误、有效引用支撑无据声明、部分落地、冲突证据等 5 项。
  • 隔离与生命周期:涉及跨命名空间泄漏、记忆删除、prompt 注入驻留、token 与成本隔离等 4 项。

官方明确表示,这是一份「威胁分类法」,并非 22 项独立测试的分母。

适用场景与定价

产品面向客户服务、商务智能体与内部 Copilot 三类买家场景,强调在「有用记忆」与「可控后果」之间取得平衡。入门方案为一次性 R$ 99(约合人民币 140 元上下),含 1,000 次 grounding 查询、30 天有效期与单命名空间,需要调用方自带阅读器密钥。

小结

AletheionAGI 本质上是把传统 RAG 流水线中「证据是否真的支撑回答」这一环单独抽取出来做成可度量、可拦截的中间件,并提供冻结评测协议作为外部验证依据。其方法学与 Vector RAG、BM25 的对比数字来自项目方自测,阅读器侧的真实质量(30.2% 矩阵安全交付率)仍取决于集成方选择的模型,整体定位偏小众工具,尚未见到独立第三方复现。

信源