桃子桃子快讯
返回首页
工具

ik_llama.cpp 本月更新:Dflash 2 推测解码与多模型支持

ik_llama.cpp 推出 Dflash 2 推测解码初步实现,验证 IQ4_KS/IQ4_KT 量化并新增 Lin…

2026.08.27 · 周四2 分钟阅读

ik_llama.cpp 是 llama.cpp 的一个活跃分支项目,长期聚焦于本地推理的性能优化与新特性实验。该项目本月集中推送了一批更新,涵盖底层构建修复、新型量化格式支持、推测解码新实现以及若干新模型的运行时适配。

CUDA 与 Vulkan 底层修复

针对 AMD GPU 生态,本次更新修复了 HIP 构建在 RDNA3 架构上的问题,并完成对 IQ4_KS 与 IQ4_KT 两种 k-量化衍生格式的验证。Vulkan 后端同步加入对这两种量化方案的支持,使更多硬件平台能够加载相关量化权重。

Dflash 2 推测解码初步实现

更新中包含「Dflash 2」相关的初始实现以及一个 DSpark 模块。推测解码是当前推理加速的常见手段,借助小型草稿模型预生成 token,再由目标模型批量校验,可在保持输出分布的前提下显著提升生成速度。本次提交的为初步实现,具体加速效果与适用模型范围有待后续实测。

新增模型运行时支持

本次更新为 Ling-3.0(又称 bailingmoe3)与 Muse-Glimmer 添加了运行时支持,意味着用户可在 ik_llama.cpp 上直接加载并推理这两个模型:

  • Ling-3.0:由蚂蚁集团开源的 MoE 架构语言模型。
  • Muse-Glimmer:相对较新的实验性模型,体量与定位信息有限。

其他优化与修复

除上述主要特性外,本月还合并了大量常规性能优化与 bug 修复,涉及注意力实现、内存管理与采样逻辑等,具体细节可在对应 PR 中查阅。

信源