桃子桃子快讯
返回首页
工具

TokenPath:从注意力中读取 LLM 输出的 token 级引用

TokenPath 通过后置读取模型注意力实现 token 级引用归属,在 LongBench-Cite 上 F1 达…

2026.07.22 · 周三3 分钟阅读

在 LLM 应用中,「模型回答的每一句究竟来自文档哪一段」一直是工程难题。Show HN 项目 TokenPath 提出了一种后置(post-hoc)方案:不改生成模型,而是在模型已经给出回答之后,再跑一次带插桩的前向传播,读取 token 级注意力并据此回溯到原文 span,作为引用依据。

工作流程:一次 API 调用完成归属

TokenPath 的接入非常轻量,不需要 SDK,也不绑定生成端模型。用户向 /v1/attributions 端点提交四类信息:源文档、问题、模型生成的完整回答、以及想要溯源的回答片段(spans)。服务端在模型上做一次插桩前向传播,把每个回答 span 下方的注意力聚合起来,返回对应的文档 span 与归属置信度。

  • 输入:document + question + answer + spans
  • 输出:每个 span 对应的 source span(含起止字符与文本)+ confidence
  • 进阶接口:/v1/attributions/heatmap 可返回原始 token 级热力图

该方案不依赖生成端的 logprobs,也不要求重新生成答案,因此可套用在任意 decoder LLM 的输出之上。

在 LongBench-Cite 上的成绩

TokenPath 公布了在 LongBench-Cite 基准(480 条测试样本)上的对比结果,统一使用同一份回答与同一个评判模型:

  • gpt-5.5 prompted:F1 0.851
  • TokenPath:F1 0.815
  • Anthropic Citations API:F1 0.812
  • embedding + rerank 基线:F1 0.622

官方称 TokenPath 与 Anthropic Citations API 效果基本持平(差距约 0.003),距离使用提示词工程的前沿 LLM 仅差 0.04 左右,但成本约低 7 倍、速度约快 5–6 倍。需要指出的是,基准由项目方自行报告,外部独立复现情况尚未披露。

定价与定位

TokenPath 采用纯按量计费,无月最低消费:

  • 注册赠送:10,000,000 tokens
  • 归属 token 定价:1.00 美元 / 百万 tokens
  • 企业可申请批量折扣与专属部署

团队在文末将产品定位为「智能体时代的引用底层」,认为随着 agent 自主读取和产出内容增多,对「模型实际引用了哪一段」的审计需求会从人类可读 footnote 转向机器可读的归属信号。整体上,TokenPath 属于在 RAG / 智能体落地中具有实用价值的基础设施型工具,而非模型层面的突破。

信源