工具
llama-cpp-turboquant 集成 ConvRot 量化方法
llama.cpp 的 turboquant 分支新增 ConvRot 量化方法,号称 Q6 即可接近 Q8 质量,并附…
2026.08.24 · 周一约 2 分钟阅读
llama.cpp 的一个第三方分支 llama-cpp-turboquant 近日合并了 ConvRot 量化方法,宣称能在 Q6 量化档位下逼近 Q8 的重建质量(以 KLD 与 PPL 为衡量指标)。原贴由该分支贡献者发布,详细测试数据已附在仓库的 PR 中。
ConvRot 量化要点
ConvRot 并非全新算法,作者提到它「始于」另一个项目,本次只是把它移植进 turboquant 分支。其核心卖点是:
- 以 Q6 量化规模换取接近 Q8 的困惑度(Perplexity)和 KL 散度表现;
- 衍生出 Q6_CR、Q5_CR 两个新量化档位,相对对应的 Q6、Q5 基础档位仅有小幅提升;
- 作者尚未验证该方法能否补偿 turbo4/3/2 此前量化带来的质量损失。
附带功能:MoE Cache 自动管理
同一分支还提供了 --moe-cache auto 选项,目标是在显存不足时更智能地调度 MoE 模型的专家层,使超出显存容量的 MoE 模型也能在本地运行。具体效果未在帖子中给出量化指标。
稳定性与注意事项
作者提到 PR 阶段曾出现 decode 异常与崩溃问题,目前已修复。帖子本身以推荐和预告为主,缺少完整的基准表格与跨模型对比,读者若要评估实际收益,仍需查阅仓库 PR 中的详细测试记录。
总体来看,这是一次针对小众本地推理用户群的功能性更新,技术方向值得跟踪,但对主流 LLM 应用与开发者的直接影响有限。
