工具
CachyLLama:给 llama.cpp 加持久化 KV 缓存的本地推理分支
CachyLLama 是 llama.cpp 的分支,通过 SSD 持久化 KV 缓存大幅削减本地智能体工作流的 pro…
2026.07.25 · 周六约 2 分钟阅读
CachyLLama 是一个面向本地大模型推理场景的 llama.cpp 分支,核心目标是解决智能体式编码工具(如 Aider、Claude Code)在本地硬件上反复处理相同 prompt 前缀带来的开销。在多轮 agent 会话里,系统提示词、工具 schema 与历史对话几乎不变,却每轮都要重新计算,prompt 处理往往占整体耗时的大头。
主要特性
- 持久化 KV 缓存:将会话 checkpoint 写入 SSD,服务器重启或断电后仍可从磁盘恢复,支持冷启动快速加载。
- 跨会话系统提示缓存:维护一个全局共享的静态前缀缓存,后续请求无需再次评估这些 token。
- 混合架构支持:可同时跟踪并恢复 MoE 与 SSM(如 Mamba)的循环状态,适配 Qwen 3.5/3.6、Gemma 4、GLM-4.7、DeepSeek-V3 等混合架构。
- 多级存储:活跃会话状态保留在 RAM,空闲会话下沉至磁盘,并借助内核 readahead 将磁盘 I/O 与计算重叠,掩盖 SSD 读取延迟。
性能数据
项目方在 AMD Ryzen 7840U / 780M 平台上公布了两组对比。需要注意的是,CachyLLama 并不加速 token 生成本身,仅消除冗余的 prompt 处理耗时。
- Prompt 约 1,243 tokens:冷启动 9.3 秒,缓存命中后 0.41 秒。
- Prompt 约 15,700 tokens:冷启动 143.1 秒,缓存命中后 0.99 秒。
在 1.5 万 token 量级下,命中缓存相比冷启动可节省超过两个数量级的时间,对长上下文的 agent 会话尤为关键。
适用场景与局限
该分支面向使用 APU 或中端 CPU/GPU 的本地推理用户,其痛点不在生成速度而在 prompt 评估速度。对于显存充裕、可一次性放下整段上下文的场景收益有限;但在多会话切换、跨进程复用相同前缀、频繁重启推理服务的场景中,能显著降低重复计算成本。项目当前以 Reddit 帖形式公开,尚未提供官方仓库链接或论文,benchmark 数据来自开发者自述。
