工具
llama.cpp 新增 --n-cpu-ffn 选项 优化低显存稠密模型推理
llama.cpp 提交 PR #26622,新增 --n-cpu-ffn 选项,允许将稠密模型的 FFN 子层卸载到…
2026.08.27 · 周四约 2 分钟阅读
llama.cpp 项目近日收到一项新的 Pull Request(#26622),提交者 John-194。该 PR 新增了 --n-cpu-ffn 命令行选项,其设计思路与现有的 --n-cpu-moe 选项类似,但面向稠密(dense)模型场景,旨在让显存有限的本地用户在跑稠密模型时获得更流畅的推理体验。
选项作用与背景
--n-cpu-ffn 允许用户指定将稠密模型中多少个 FFN(前馈网络)子层放在 CPU 上运行。这与 --n-cpu-moe 的逻辑一致——后者用于 MoE 架构模型,按层数或专家数将部分计算卸载到 CPU。而新选项把同样的思路推广到了稠密 Transformer 的 FFN 子层。
适用场景
根据提交者的简短说明,这项改动主要服务于 VRAM 不足、需要在 CPU 与 GPU 之间分担 FFN 计算的用户。通过将部分 FFN 子层卸载到 CPU,可以降低 GPU 显存压力,从而在消费级显卡上运行更大或更多的稠密模型实例。
现状与局限
需要注意的是,原帖仅给出了 PR 的概要说明,尚未公布具体的性能提升数据、对比 benchmark 或详细的使用文档。该功能仍处于社区贡献阶段,是否会被合并入主分支、以及最终接口是否会有调整,仍有待项目维护者 review 后确认。感兴趣的开发者可在 llama.cpp 的 GitHub 仓库(ggml-org/llama.cpp)中跟踪 PR #26622 的后续进展。
