桃子桃子快讯
返回首页
工具

llama.cpp 升级 ROCm 至 7.14,Radeon 780m iGPU 基准对比 Vulkan

llama.cpp 升级 ROCm 7.2 到 7.14,新增 gfx1103 支持;社区基准显示 ROCm 对稠密模型…

2026.08.17 · 周一3 分钟阅读

llama.cpp 近期完成了一次较受关注的底层升级:其 ROCm 后端从 7.2 升至 7.14。ROCm 7.14 正式加入了对 gfx1103 架构的支持,这正好覆盖了 AMD Radeon 780m 这类广泛使用的集显平台。不过官方预编译包尚未默认开启 gfx1103 构建目标,用户需要从源码自行编译才能启用。

基准测试条件

Reddit 用户 MaximusSenior 在 Ryzen 7 260(搭配 Radeon 780m 集显)、64GB DDR5-5600 内存、Ubuntu 26 系统下,使用 llama-bench 进行了对比测试,关键参数如下:

  • 模型量化:-ctk q8_0 / -ctv q8_0
  • 线程:8
  • 注意力:--flash-attn on
  • 上下文长度:8192 与 16384
  • 生成长度:128 与 256

测试对象为两款 Qwen 系列模型:Qwen 3.6 35B-A3B(MoE)Q8 与 Qwen 3.8 27B(稠密)Q8,均来自 Unsloth 量化版本。

ROCm vs Vulkan 实测结果

MoE 模型(Qwen 3.6 35B-A3B Q8):

  • pp8192:ROCm 311.44 t/s,Vulkan 288.31 t/s
  • pp16384:ROCm 278.58 t/s,Vulkan 260.65 t/s
  • tg128:ROCm 18.35 t/s,Vulkan 21.14 t/s
  • tg256:ROCm 17.98 t/s,Vulkan 21.09 t/s

稠密模型(Qwen 3.8 27B Q8):

  • pp8192:ROCm 97.48 t/s,Vulkan 66.45 t/s
  • pp16384:ROCm 90.66 t/s,Vulkan 63.39 t/s
  • tg128:ROCm 2.71 t/s,Vulkan 2.85 t/s
  • tg256:ROCm 2.33 t/s,Vulkan 2.18 t/s

结论与使用建议

从结果可以得出两个明确结论:

  • 对稠密模型(如 27B Q8),ROCm 在 prompt 处理阶段比 Vulkan 快约 50%,是更优选择。
  • 对 MoE 模型(如 35B-A3B Q8),ROCm 在生成阶段反而略慢于 Vulkan,优势仅体现在 prefill 阶段。

作者还指出一个稳定性问题:在 ROCm 模式下必须移除内核参数 amdgpu.gttsize=49152,否则会出现频繁崩溃;该参数可能与 ROCm 推荐的 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 环境变量存在冲突,需要进一步排查。

整体来看,本次 ROCm 升级让 AMD iGPU 平台跑本地大模型的可行性显著提升,尤其在稠密模型场景下表现亮眼,但 MoE 与生成速度仍有优化空间。

信源