桃子桃子快讯
返回首页
研究论文

Nexus 改进 MCP 工具路由与 KV 缓存

Nexus 通过检索解耦路由与模式预填充,在大规模工具注册表下提升智能体首个参数 token 的生成速度。

2026.08.24 · 周一2 分钟阅读

针对基于模型上下文协议(MCP)的智能体大模型,研究论文《Nexus》提出了一套工具选择与上下文复用方案。论文指出,工具注册表扩大后,每轮重新编码冗长工具模式会显著增加模式预填充成本,使其逐渐成为首 token 生成时间的主要开销。

解耦工具路由与模式预填充

Nexus 的主要思路,是把工具检索与完整模式预填充分开。系统使用 INT8 量化语义旁路缓存和经校准的交叉编码器边界门控选择工具,再让模型基于压缩后的文本签名生成参数。该签名的中位长度为 19 个 token,因此不必为每轮路由拼接全部工具模式。

在工具注册规模扩展至 250 个工具时,Nexus 的路由准确率仍接近 89%。相比之下,拼接全部工具模式的基线方法会直接超出上下文窗口。采用 Nexus 后,首个参数 token 的生成速度达到完整模式重新预填充的 1.66 倍,同时节省约 80% 的主上下文 token。

KV 缓存拼接的边界

作为辅助方案,Nexus 还会把已编译的工具模式键值缓存块直接移植到当前上下文。在位置准确对齐时,这种方式能够保持输出一致;但错位放置会受到旋转位置嵌入相位漂移影响,进而破坏注意力结果。

为处理这一问题,论文引入了深度自适应的后缀重解码机制。当上下文深度超过阈值 P=256 时,系统会从局部修复逐步升级至完整重新预填充。论文强调,不倒退性质保证的是输出保真度,而非延迟性能:top-1 结果保持一致,D_KL 约为 0,但延迟最低可能降至原来的 0.98 倍,之后才逐渐回到与基线相当的水平。

性能表现与适用范围

实验显示,Nexus 在中等上下文深度下可获得 1.1 至 1.7 倍的首 token 生成加速,但随着上下文加深,优势会缩小并最终趋于与完整重新预填充持平。

所有测量均基于 Qwen2.5-14B-Instruct Q4_K_M 与 Apple 芯片统一内存环境。论文认为,定性层面的技术边界具有可推广性,但具体性能区间依赖所使用的模型、量化和硬件组合,因此其结果不能直接外推至所有智能体系统。

信源