MI50 推理功耗实测:50W 即可获得七成峰值速度
Reddit 用户在 AMD MI50 上对 Qwen3.6-35B-A3B 做功耗限频测试,发现 50W 即可获得 7…
一名社区用户在 AMD MI50 16GB 上对 Qwen3.6-35B-A3B 模型做了系统性功耗限频测试,覆盖 190W、100W、50W、20W 四档,使用 LACT 进行功耗控制,并借助 pi.dev 基准测试工具记录提示处理与文本生成阶段的 token/s、能耗比与图复用次数。结果显示,生成速度对功耗下调的容忍度远高于提示处理速度,50W 是兼顾性能与能效的最佳工作点。
测试环境与方法
硬件平台包括 Ryzen 5 5600 处理器、双条 16GB DDR4-2667 内存以及一块 MI50 16GB。系统为 Arch Linux(内核 7.1.4-arch1-1),推理框架跑在 mixa3607/llama.cpp-gfx906:b10087-rocm-6.3.3 容器内。模型为 qwen/Qwen3.6-35B-A3B-UD-IQ4_NL_XL.gguf,上下文长度 262144,KV cache 量化 K=q8_0 / V=q8_0,MoE 层部分卸载到 CPU,开启 2 个推理槽,批大小 2048/1024。每个功耗档位取三次测试均值。
关键发现
- 生成阶段主要由显存带宽决定,对功耗下调不敏感:100W 时生成速度仍可达到 190W 的 97.5%(31.98 vs 32.79 t/s)。
- 50W 下生成速度为 22.92 t/s(峰值 70%),但功耗仅为峰值的 26%,能效比从 0.173 t/s/W 提升至 0.458 t/s/W,约为 3.6 倍。
- 20W 时能效比再上一个台阶,达 1.040 t/s/W,但提示处理速度跌至峰值的 53%(366 t/s)。
- 提示处理比生成阶段更吃算力:功耗从 190W 降到 20W,提示处理速度由 691 t/s 跌至 366 t/s(53%),生成速度则仅从 32.8 t/s 降到 20.8 t/s(63%)。
- 图复用次数与功耗并非单调关系:190W 时复用 44790 次,100W 跌至 11669,20W 又回升到 38248,说明调度器在低功耗下会做更多部分图复用以补偿被限制的算力。
各档位实测数据
| TDP | Prompt t/s | Gen t/s | 总耗时 | 总 Token | t/s per W | 图复用 | 相对性能 |
|---|---|---|---|---|---|---|---|
| 190W | 691.28 | 32.79 | 212.4 s | 14,892 | 0.173 | 44,790 | 100% |
| 100W | 603.08 | 31.98 | 244.9 s | 21,529 | 0.320 | 11,669 | 97.5% |
| 50W | 401.14 | 22.92 | 315.1 s | 20,861 | 0.458 | 31,967 | 70.0% |
| 20W | 366.05 | 20.80 | 319.9 s | 20,295 | 1.040 | 38,248 | 63.4% |
值得注意的是,190W 配置在三次测试中一致性较差,总 token 数显著偏低,并且有 1/3 的运行未产出有效文件。
结论与建议
对以生成为主的推理负载,MI50 在 50W 档位接近峰值性能,同时大幅降低功耗与散热压力,是综合最优工作点。100W 适合需要最大化生成速度但仍关注能耗的场景;20W 适合极致省电或散热受限的部署,但需要接受提示处理速度近半的损失。该测试结果对使用类似 gfx906 架构 GPU 做本地推理的用户具有直接参考价值。
