社区开发者为 Qwen3.8 Flash Next 实现 KVA 投影器,预填速度最高提升 1.85 倍
Reddit 用户 Dyluhn 发布 KVA 投影器实现,基于 DeepSeek V4.1 Flash 与 HySpa…
Reddit 用户 Dyluhn 在 r/LocalLLaMA 发布了一项面向本地大模型推理的优化成果:通过为 Qwen3.8 Flash Next(QFN)添加自研的 KVA(Key-Value Attention)投影器,在仅小幅增加困惑度的前提下,将预填(prompt processing)速度提升至多 1.85 倍。该方法借鉴了 DeepSeek V4.1 Flash 与 HySparse2/MiMo-V3 中的相关思路,并已在 Hugging Face 开源。
实现思路与单层投影器效果
作者指出,KVA 投影器的核心思想是为模型较早层生成对后续层输入的近似预测,从而跳过部分实际计算。其实现与此前常见的 KVA 投影方案存在三点差异:
- 每层使用一张完整的映射表,并通过 Tikhonov 正则化(岭回归)拟合,相较常见的逐层 + 训练修正头方案准确度更高,但显存占用从约 400 MB 上升到约 1.5 GB。
- 仅预测后续层的输入张量,再借助模型自身权重计算键值对,而非直接预测 K/V。
- 起始层可由用户自由配置(测试中覆盖 12、16、24 三档),便于按场景在速度与困惑度之间取舍。
在 BetterBench 上的逐档结果如下:
- 第 12 层起启用:预填速度从 1700 t/s 提升至 3150 t/s,约 1.85 倍加速,困惑度上升约 8%。
- 第 16 层起启用:预填速度提升至 2900 t/s,约 1.7 倍加速,困惑度上升约 5%。
- 第 24 层起启用:预填速度提升至 2500 t/s,约 1.45 倍加速,困惑度上升约 2.6%。
作者将这一思路类比为「MTP(多 token 预测)应用于预填阶段」,但强调其并非无损,误差会进入模型后续层;像 DeepSeek V4.1 这类原生训练中已纳入类似机制的模型对困惑度抬升更耐受,而 QFN 等未经对应训练的模型则会出现明显的困惑度上涨。
第二版:多层投影器与综合基准
在 HySparse2 论文的启发下,作者还构建了多层版本的投影器(V2),目前仍处于早期测试阶段,R9V 引擎已加入相关能力,但尚未确认稳定。初步结果显示:
- 多层投影器在仅增加约 2% 困惑度的前提下,可获得约 1.55 倍预填加速。
- 作者认为,通过架构层面的调整,有望在保持困惑度增加低于 1% 的同时实现约 1.5 倍提速。
在 R9V 引擎(针对 2 张 AMD R9700 + 128 GB DDR5 平台优化)上的 BetterBench 综合表现如下:
- 预填速度:约 3600 t/s(64k token)。
- 解码速度:加权综合约 74.7 t/s。
- 并发:8 路流约 70.3 t/s。
- TTFT(P50):单流约 338 ms;P99 更新延迟约 51.5 ms。
需注意的是,运行时专家存储约占用 50 GB 主机内存,若使用 PLE/En-grams 则通常需要 SSD 或将其放入内存以保证可用速度。
开源资源与生态
作者已在 Hugging Face 发布两份资产:
- IQ4_XS 量化的 QFN 模型 + MTP + KVA V1 投影器,已可直接用于 R9V。
- 仅包含 V1 与 V2 投影器的仓库,供其他 VLLM 项目参考接入方式。
V2 多层投影器目前以配置开关(--ced quality)形式隐藏在 R9V 中,供愿意尝鲜的用户手动启用。
作者也在文中特别提到,Hugging Face 用户 kishida 较早发现了 DeepSeek V4.1 的相关特性可与模型架构解耦、独立借鉴,对本次工作有直接启发。
