TokenPath:从注意力中读取 LLM 输出的 token 级引用
TokenPath 通过后置读取模型注意力实现 token 级引用归属,在 LongBench-Cite 上 F1 达…
在 LLM 应用中,「模型回答的每一句究竟来自文档哪一段」一直是工程难题。Show HN 项目 TokenPath 提出了一种后置(post-hoc)方案:不改生成模型,而是在模型已经给出回答之后,再跑一次带插桩的前向传播,读取 token 级注意力并据此回溯到原文 span,作为引用依据。
工作流程:一次 API 调用完成归属
TokenPath 的接入非常轻量,不需要 SDK,也不绑定生成端模型。用户向 /v1/attributions 端点提交四类信息:源文档、问题、模型生成的完整回答、以及想要溯源的回答片段(spans)。服务端在模型上做一次插桩前向传播,把每个回答 span 下方的注意力聚合起来,返回对应的文档 span 与归属置信度。
- 输入:document + question + answer + spans
- 输出:每个 span 对应的 source span(含起止字符与文本)+ confidence
- 进阶接口:
/v1/attributions/heatmap可返回原始 token 级热力图
该方案不依赖生成端的 logprobs,也不要求重新生成答案,因此可套用在任意 decoder LLM 的输出之上。
在 LongBench-Cite 上的成绩
TokenPath 公布了在 LongBench-Cite 基准(480 条测试样本)上的对比结果,统一使用同一份回答与同一个评判模型:
- gpt-5.5 prompted:F1 0.851
- TokenPath:F1 0.815
- Anthropic Citations API:F1 0.812
- embedding + rerank 基线:F1 0.622
官方称 TokenPath 与 Anthropic Citations API 效果基本持平(差距约 0.003),距离使用提示词工程的前沿 LLM 仅差 0.04 左右,但成本约低 7 倍、速度约快 5–6 倍。需要指出的是,基准由项目方自行报告,外部独立复现情况尚未披露。
定价与定位
TokenPath 采用纯按量计费,无月最低消费:
- 注册赠送:10,000,000 tokens
- 归属 token 定价:1.00 美元 / 百万 tokens
- 企业可申请批量折扣与专属部署
团队在文末将产品定位为「智能体时代的引用底层」,认为随着 agent 自主读取和产出内容增多,对「模型实际引用了哪一段」的审计需求会从人类可读 footnote 转向机器可读的归属信号。整体上,TokenPath 属于在 RAG / 智能体落地中具有实用价值的基础设施型工具,而非模型层面的突破。
