桃子桃子快讯
返回首页
研究论文

LatentPort:无需前缀重放的跨模型循环状态迁移

arXiv 论文提出 LatentPort,可在架构匹配的 Qwen3.5 4B 与 9B 之间迁移循环推理状态,无需目…

2026.09.24 · 周四3 分钟阅读

arXiv 上发布了一篇题为《LatentPort: Cross-model recurrent state transfer without prefix replay》的预印本论文,研究如何在不重读上下文的前提下,让一个语言模型将其「在线记忆」交接给另一个模型。作者在架构匹配的 Qwen3.5 4B 与 9B 这一对 sibling 模型上演示了持久混合状态的迁移,并声称这是首次在不同尺寸的混合语言模型之间完成无需目标前缀回放的持久循环推理状态跨模型交接。

核心思路

传统做法是将教师模型的 KV 缓存(attention KV)翻译后交给学生模型,但作者指出,仅 KV 翻译会留下显著的能力差距。为此,论文在翻译后的 KV 之上额外加入了 Gated DeltaNet(GDN)的持久状态包,组合后效果显著优于单独的 KV 翻译。论文还对比了直接复用循环与卷积状态与学习式 GDN 映射两种路径,发现前者更优,提示持久状态坐标在不同模型间存在「部分功能兼容」。

关键实验数据

  • 在 64 份 PG19 文档上,teacher-forced 负对数似然(NLL,即模型对真实下一 token 取负对数概率,越低越好)平均下降 0.747 nats/token,95% 配对文档 bootstrap 置信区间为 [0.6921, 0.8047],全部 64 份文档均有改善。
  • 组件因子分解选定「翻译 KV + 直接循环/卷积状态」组合作为基础方案。
  • 在基础方案上额外引入 434,176 个参数的校正模块,于 64 份新的网页文档上:续写损失仅高于原生 9B 模型 0.076 nats/token,Jensen-Shannon 散度(JSD,衡量两个分布在每一步的差异)为 0.022,原生上下文恢复率(NCR,续写分布与原生模型的吻合比例)达到 0.918。
  • 经校正后的 9B 在零历史前缀 token 条件下,显著优于沿用 4B 推理的对照。

局限与适用范围

论文同时明确指出当前证据的边界:

  • 仅覆盖一个方向、一对几何匹配的 Base 模型,token 长度 4K 的 teacher-forced 续写。
  • 「近原生门控」(near-native gate)方案未能成功,16K 分支未运行。
  • 自由生成(free generation)下的等价性、跨家族模型的通用状态接口仍未验证。

意义与方向

对于关注推理效率、KV 缓存压缩与跨模型状态可移植性的研究者而言,这项工作提供了一个具体的基线与可复现的实验设定。它表明,在尺寸相近、架构一致的混合(hybrid)模型之间,部分循环状态坐标可能存在可直接复用的功能结构,而轻量级参数校正即可进一步弥合迁移带来的能力损失。但要走向实用化,仍需在更多模型家族、更长上下文以及自由生成条件下复现与扩展。

信源