工具
llama.cpp 升级 ROCm 至 7.14,Radeon 780m iGPU 基准对比 Vulkan
llama.cpp 升级 ROCm 7.2 到 7.14,新增 gfx1103 支持;社区基准显示 ROCm 对稠密模型…
2026.08.17 · 周一约 3 分钟阅读
llama.cpp 近期完成了一次较受关注的底层升级:其 ROCm 后端从 7.2 升至 7.14。ROCm 7.14 正式加入了对 gfx1103 架构的支持,这正好覆盖了 AMD Radeon 780m 这类广泛使用的集显平台。不过官方预编译包尚未默认开启 gfx1103 构建目标,用户需要从源码自行编译才能启用。
基准测试条件
Reddit 用户 MaximusSenior 在 Ryzen 7 260(搭配 Radeon 780m 集显)、64GB DDR5-5600 内存、Ubuntu 26 系统下,使用 llama-bench 进行了对比测试,关键参数如下:
- 模型量化:-ctk q8_0 / -ctv q8_0
- 线程:8
- 注意力:--flash-attn on
- 上下文长度:8192 与 16384
- 生成长度:128 与 256
测试对象为两款 Qwen 系列模型:Qwen 3.6 35B-A3B(MoE)Q8 与 Qwen 3.8 27B(稠密)Q8,均来自 Unsloth 量化版本。
ROCm vs Vulkan 实测结果
MoE 模型(Qwen 3.6 35B-A3B Q8):
- pp8192:ROCm 311.44 t/s,Vulkan 288.31 t/s
- pp16384:ROCm 278.58 t/s,Vulkan 260.65 t/s
- tg128:ROCm 18.35 t/s,Vulkan 21.14 t/s
- tg256:ROCm 17.98 t/s,Vulkan 21.09 t/s
稠密模型(Qwen 3.8 27B Q8):
- pp8192:ROCm 97.48 t/s,Vulkan 66.45 t/s
- pp16384:ROCm 90.66 t/s,Vulkan 63.39 t/s
- tg128:ROCm 2.71 t/s,Vulkan 2.85 t/s
- tg256:ROCm 2.33 t/s,Vulkan 2.18 t/s
结论与使用建议
从结果可以得出两个明确结论:
- 对稠密模型(如 27B Q8),ROCm 在 prompt 处理阶段比 Vulkan 快约 50%,是更优选择。
- 对 MoE 模型(如 35B-A3B Q8),ROCm 在生成阶段反而略慢于 Vulkan,优势仅体现在 prefill 阶段。
作者还指出一个稳定性问题:在 ROCm 模式下必须移除内核参数 amdgpu.gttsize=49152,否则会出现频繁崩溃;该参数可能与 ROCm 推荐的 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 环境变量存在冲突,需要进一步排查。
整体来看,本次 ROCm 升级让 AMD iGPU 平台跑本地大模型的可行性显著提升,尤其在稠密模型场景下表现亮眼,但 MoE 与生成速度仍有优化空间。
