桃子桃子快讯
返回首页
开源

llama.cpp 新 PR:ROCm 提示处理提速约 15%,修复 Q2_K 性能 bug

llama.cpp 社区出现新 PR,声称在 AMD ROCm 上将 prompt 处理速度提升约 15%,并修复导致…

2026.07.21 · 周二2 分钟阅读

llama.cpp 项目出现一项新的拉取请求(PR),据提交者称可在 AMD ROCm 平台上将 prompt 处理(prompt processing)性能提升约 15%,同时修复了一个长期存在的 bug——该 bug 导致 Q2_K 量化方案的推理速度比预期慢约 28 倍。社区讨论认为,这两项改动结合起来,有望让此前因性能问题被视为「不可用」的极端量化方案,在 AMD 显卡上重新具备实用价值。

改动要点

  • Prompt 处理提速约 15%:在 ROCm 后端上,模型加载和上下文预处理阶段获得明显加速,对长 prompt 场景更友好。
  • Q2_K 性能修复:修复后 Q2_K 量化的推理速度提升约 28 倍,回归到与其它量化档位相近的水平。
  • 实际效果:社区评论认为,更极端的量化配置(如 Q2_K、IQ 系列)在 AMD 显卡上的可用性将显著改善。

背景:llama.cpp 与 ROCm

llama.cpp 是目前本地部署大语言模型最主流的开源推理引擎之一,由 Georgi Gerganov 发起,支持 CPU、CUDA、ROCm、Metal、Vulkan 等多种后端。其中 ROCm 后端面向 AMD 显卡用户,长期以来在性能与稳定性上与 NVIDIA CUDA 后端存在差距,因此相关的优化 PR 一直备受社区关注。

Q2_K 是 GGUF 格式中一种激进的低比特量化方案,能在有限显存下运行更大的模型,但历史上在部分后端因实现 bug 导致速度远低于理论值。

当前状态

截至目前,该 PR 仍在审核阶段,尚未合并到主分支。开发者可通过自行构建对应分支进行测试。具体的 benchmark 数据、测试显卡型号与模型规模等细节,社区讨论中尚未给出,PR 合并后预计会补充更完整的性能对比。

信源