桃子桃子快讯
返回首页
工具

Qwen3-Next-Flash 在 4 卡 R9700 上跑出 120 t/s

经 MXFP4-FP8 量化与定制 vLLM 优化后,Qwen3-Next-Flash 在 4 张 AMD R9700…

2026.08.31 · 周一3 分钟阅读

近日,Reddit r/LocalLLaMA 用户 sloptimizer 分享了一组本地推理基准:在 4 张 AMD R9700 显卡上,配合社区开发者 tcclaviger 提供的 MXFP4-FP8 量化权重与定制 vLLM Docker 镜像,Qwen3-Next-Flash 单请求生成速度可达 80–120 tokens/s,预填充速度高达 12k tokens/s。这是目前公开渠道中,针对该模型与 R9700 平台较为完整的一组本地性能数据。

性能数据与硬件配置

测试平台为 4 卡 AMD R9700,使用 tcclaviger 维护的定制镜像 docker.io/tcclaviger/vllm:DevQwenNextFlash,权重为 tcclaviger/Qwen3.8-Flash-Next-MXFP4-FP8。关键指标如下:

  • 单请求生成速度:80–120 tokens/s
  • 单请求预填充速度:约 12k tokens/s
  • 张量并行:TP=4
  • KV 缓存精度:FP8
  • 推测解码:MTP,4 个 speculative tokens

作者同时给出了启动所用的 Podman 命令,覆盖 CPU offload、ROCm AITER、cudagraph 捕获尺寸等参数设置。

量化与推理栈要点

本次实测的核心在于「MXFP4-FP8」混合量化权重与针对 R9700(基于 RDNA 4 架构)调整的 vLLM 构建。值得关注的几点配置:

  • 显存利用率设为 0.96,KV cache 使用 FP8 以降低显存占用
  • 启用 prefix caching 与 chunked prefill,平衡长短请求
  • max-num-seqs 设为 16,配合 cudagraph 捕获 [5,10,15,20,25,30,35,40] 的批次尺寸
  • 通过 VLLM_PLE_CPU_OFFLOAD=1 在显存吃紧时可向 CPU 卸载部分参数

意义与局限

对持有 R9700 多卡、关注 Qwen3-Next 系列本地部署的用户而言,这条帖子提供了目前较难获取的端到端参考配置与吞吐数字。MXFP4 作为较新的微缩格式,能够在保持模型能力的同时显著降低显存占用,与 FP8 KV cache 的搭配也契合 AMD 新一代消费级显卡的定位。

需要指出的是,该数据来源于社区分享的单条测试,尚未见更广泛的跨平台复现;同时 80–120 t/s 的区间跨度较大,具体表现取决于 prompt 长度、是否启用投机解码以及批大小等条件。作为参考尚可,作为通用基准仍需更多独立验证。

信源