工具
llama.cpp 集中推进 CPU 推理优化:50 余项 PR 待合并
Reddit 用户整理 llama.cpp 仓库中尚未合并的 CPU / 内存 / 磁盘 / 混合推理相关 PR,涉及量…
2026.08.30 · 周日约 3 分钟阅读
近日,Reddit 用户 pmttyji 在 r/LocalLLaMA 板块发布了一份 llama.cpp 仓库「未合并 PR」清单,主题聚焦于 CPU / RAM / 磁盘 / 混合推理场景下的性能优化。该用户表示,这些 PR 一旦落地,有望在年底前带来更快的推理速度,主要面向「无独显或仅有入门显卡」的本地大模型用户群体。
优化方向概览
清单涵盖多条技术线,核心思路是在不同硬件架构上榨取量化模型的 CPU 算力,同时补齐大模型在内存受限场景下的运行能力:
- 量化内核加速:在 AVX2、AVX-512、VNNI、NEON、SVE、RISC-V V 等 SIMD 指令集上重写或新增 Q2_0、Q4_K、Q5_K、Q6_K、IQ、TQ1_0 等量化格式的 vec_dot 内核;
- 预填充与解码优化:包括 CPU flash-attn 量化 K/V 支持、soft_max 融合、rms_norm 向量化与写回融合、batch-1 解码加速等;
- NUMA 与跨节点调度:通过 NUMA_MIGRATE、--numa mirror、NUMA 架构下的 repack buffer 优化等手段降低跨节点访存开销;
- MoE 专家调度与磁盘卸载:提出 hot experts 缓存、--lazy-experts、pshard 流式权重、Metal 端 MoE 磁盘卸载等方案,应对超大 MoE 模型;
- KV 缓存与服务端能力:例如 /slots 接口新增 clone_to 动作,支持 slot 间 KV 复制。
新增量化格式支持
针对未来模型可能使用的低精度格式,清单中还包含若干新增量化类型的实现工作:
- ROCmFP4 CPU 量化
- MXFP8 CPU 支持
- MXFP6 CPU 初始实现
- E4M3(fp8)CPU 量化类型
典型性能收益
个别 PR 在合并说明中给出了参考提速幅度,例如 #26348 标注在 VNNI 兼容 CPU 上 Q2_0 点积获得约 3 倍提速,#23309 在 AVX-VNNI 系统上为 q4_K_8x8_q8_K 带来 +12% ~ +23% 的 tok/s 收益。需要注意的是,这些数字多基于 PR 作者自测,实际效果需以正式合并版本为准。
现状与展望
该清单由社区用户自发整理,覆盖了仓库大量尚未合并的 PR 与讨论(如 RFC #24528 提出的 MoE 专家缓存方案)。原作者强调,这些变更距离「年底前全面落地」的目标仍有约 50 个 PR 的工作量,并呼吁有经验的开发者参与贡献。对于在 CPU 或混合硬件上部署本地大模型的用户而言,可以持续关注这些 PR 的合并进展,以便在新版本中享受性能红利。
