桃子桃子快讯
返回首页
工具

llama.cpp 新增 Vulkan int8 矩阵乘,AMD RDNA3/4 推理提速

llama.cpp 针对 AMD RDNA3 与 RDNA4 显卡加入 Vulkan int8 coopmat1 矩阵乘…

2026.09.24 · 周四3 分钟阅读

llama.cpp 项目近期合并了一项针对 AMD RDNA3 与 RDNA4 架构显卡的 Vulkan int8 coopmat1 矩阵乘实现,在 RX 7900XTX 上对 Gemma 系列 MoE 模型的推理性能带来了明显改善,相关基准数据由提交者 nickm_27 在社区中公开。

性能提升幅度

根据 7900XTX 上的实测数据,使用 Gemma 26B.A4B Q4_0 量化模型时,多项测试场景的速度均较此前实现有所提升:

  • pp512(prompt 处理):从 3410.53 t/s 提升至 4331.21 t/s,幅度约 27%
  • tg128(文本生成):从 135.64 t/s 提升至 142.76 t/s,幅度约 5%
  • pp512 @ d8192:从 2477.27 t/s 提升至 2885.67 t/s
  • tg128 @ d8192:从 120.42 t/s 提升至 125.29 t/s
  • pp512 @ d16384:从 2130.36 t/s 提升至 2402.13 t/s
  • tg128 @ d16384:从 118.42 t/s 提升至 120.82 t/s

可以看到,prompt 处理阶段的提速幅度普遍大于文本生成阶段,且短上下文下的改善最为明显。

技术背景

Vulkan 是跨平台 GPU 计算接口,cooperative matrix(coopmat)是 Vulkan 扩展提供的一种硬件加速矩阵运算能力。int8 coopmat1 利用 8 位整数精度执行矩阵乘,能在保持合理精度的同时降低显存带宽与计算开销,适合大模型推理中的量化计算路径。本次更新将这一能力带到 AMD RDNA3(RX 7000 系列)与 RDNA4(RX 9000 系列)架构,意味着使用上述显卡运行 llama.cpp 的用户无需更换硬件即可获得更快的本地推理速度。

对本地 LLM 用户的意义

llama.cpp 是当前本地大模型推理的主流开源项目之一,支持 CPU、Apple Silicon、NVIDIA、AMD 等多种硬件后端。此次针对 AMD RDNA 显卡的 Vulkan 后端优化,缩小了 AMD 与 NVIDIA 在本地推理体验上的部分差距,对持有较新 AMD 显卡的玩家和开发者而言是一次值得关注的性能改进。需要注意的是,目前公开的实测仅基于 7900XTX 一款硬件,其他型号显卡的提升幅度仍有待更多社区验证。

信源