桃子桃子快讯
返回首页
工具

AMD 自维护 llama.cpp 分支实测:Strix Halo 提示处理速度翻倍

社区用户测试发现,AMD 官方维护的 llama.cpp 分支在 Strix Halo 上对稠密模型的 prompt p…

2026.08.23 · 周日2 分钟阅读

近日,Reddit 用户 /u/PromptInjection_ 在 r/LocalLLaMA 板块分享了对 AMD 官方维护的 llama.cpp 分支(AMD-Ecosystem/llama.cpp)的性能实测结果,提示该分支虽然在仓库中带有「已弃用」标识,但事实上仍处于活跃维护状态,相关更新最终也会合入主线 llama.cpp。

实测硬件与场景

测试机型搭载 AMD Strix Halo 平台,使用 ROCm / HIP 后端运行本地推理。对比对象分别为该 AMD 分支、Vulkan 后端以及主线 llama.cpp,覆盖稠密模型(dense)与 MoE 模型两种结构。

稠密模型:Prompt Processing 提速超过 2 倍

  • 在 14B 稠密模型上,AMD 分支的 prompt processing(PP)速度达到约 550 tokens/s,而主线 llama.cpp 仅有约 230 tokens/s,性能提升超过 2 倍。
  • 这一差距主要来自 AMD 分支针对 ROCm / Hip 路径新增的若干补丁(patches),尚未全部进入上游主线。

文本生成与 MoE:无显著收益

  • 与基于 Vulkan 后端相比,AMD 分支的 text generation(TG)速度反而低约 15%,意味着 PP 的领先并不能在生成阶段延续。
  • MoE 模型在该分支下的速度与主线持平,没有观察到额外收益。

实际意义

对使用 AMD 显卡(尤其是 Strix Halo 这类 APU)进行本地大模型推理的用户而言,AMD-Ecosystem 分支在长 prompt 场景(系统提示、上下文注入、RAG 预处理)下能带来显著的吞吐提升,但在以生成为主的推理任务中优势有限。用户可按工作负载的 PP/TG 比例,决定是否切换至该分支。

信源