DKV:面向本地推理的开源 KV-cache 压缩框架
开发者发布开源框架 DKV,通过锚点表示、低秩压缩与稀疏路由注意力降低 KV-cache 显存,面向长上下文本地推理场景…
一个名为 DKV(DifferentialKV)的开源框架近日在 Reddit 的 r/LocalLLaMA 社区发布,专注于解决长上下文本地大语言模型推理中的 KV-cache 显存占用问题。作者透露,该项目经过约五个月的开发,目前已在 GitHub 开源,并配套发布了一份技术报告。
项目目标与核心思路
KV-cache 是大模型自回归推理过程中用于缓存历史 token 键值对的结构,其显存占用通常随上下文长度线性增长,是本地部署长上下文模型的主要瓶颈之一。DKV 的设计目标是压缩这一缓存,从而降低显存需求,使消费级硬件也能运行更长上下文的推理任务。
根据作者介绍,DKV 采用了四种关键技术组合:
- 基于锚点(anchor-based)的表示方式,用少量代表性位置近似完整缓存;
- 联合低秩压缩(joint low-rank compression),在通道维度上压缩 KV 张量;
- 精确残差保留(exact residual preservation),避免近似误差累积;
- 稀疏路由注意力(sparse routed attention),在注意力计算阶段只访问压缩后的关键位置。
当前实现状态
项目仓库已提供命令行工具(CLI),使用者无需自行编写集成代码即可开始实验。后端方面,DKV 目前已支持 MLX(Apple Silicon 生态),并正在验证 CUDA 后端。作者表示仍在持续改进项目,并希望通过社区反馈完善架构与基准测试。
与同类项目的关系方面,作者提到希望未来能与 llama.cpp、vLLM、SGLang 等主流本地推理与服务框架进行集成,以扩大适用范围。
技术报告与可用资源
与代码同步发布的还有一份技术报告,托管在 Zenodo 平台,包含详细的设计说明与评估内容。感兴趣的开发者可通过以下链接查看:
- GitHub 仓库:https://github.com/Omc12/Differential-KV
- 技术报告(DOI):https://doi.org/10.5281/zenodo.21539110
社区反响与定位
作者发布该帖的主要目的是收集来自本地推理领域开发者的技术反馈,包括对架构、benchmark 设计以及潜在集成方案的讨论。该项目目前仍处于早期阶段,CUDA 后端尚未完成验证,缺少公开的具体压缩比与速度基准数据,对于关注 KV-cache 优化的工程社区而言,可作为一个可尝试与可贡献的新选项。
