桃子桃子快讯
←返回首页
工具

社区实测:Qwen3 30B-A3B 在单卡 RTX 5090 上 MTP 推理达 85.6 tok/s

Reddit 用户在单张 RTX 5090 上运行 Qwen3 30B-A3B 并启用 MTP,测得约 85.6 tok…

2026.09.26 · 周六约 3 分钟阅读

近日 Reddit 社区 r/LocalLLaMA 上有用户分享了一组本地推理性能数据:在单张 NVIDIA RTX 5090 显卡上运行 Qwen3 30B-A3B(即原帖所称的 Qwen3.8:27b,属 Qwen3 系列的 MoE 架构模型),并开启 MTP(Multi-Token Prediction,多 token 预测)解码,最终测得约 85.6 tokens/s 的生成速度。该数据为社区用户自行跑出的结果,并非官方 benchmark。

测试背景:Qwen3 30B-A3B 与 MTP

Qwen3 30B-A3B 是阿里通义千问团队在 2025 年推出的 Qwen3 系列中的一款稀疏激活 MoE 模型,总参数约 303 亿,但每次推理仅激活约 30 亿参数,因而对显存与算力的实际需求接近一个 30B 级别的稠密模型。该模型原生支持 MTP 机制——即在每一步解码时让模型额外预测后续多个 token 的草稿,再由后续步骤校验或接受,从而在保持输出质量的前提下显著提升推理吞吐。MTP 概念最早由 DeepSeek-V3 等项目推动,目前已成为主流 MoE 推理框架(如 vLLM、SGLang、Transformers)的常见加速选项。

硬件条件:RTX 5090

RTX 5090 是 NVIDIA 于 2025 年初推出的消费级旗舰显卡,基于 Blackwell 架构,配备 32GB GDDR7 显存与约 1792 GB/s 的显存带宽,是目前单卡可运行中等规模 MoE 模型的代表性硬件。原帖明确测试环境为「单卡 RTX 5090」,并未披露所用推理框架、量化精度、batch size、context length 等关键参数,因此该 85.6 tok/s 的数字应理解为特定配置下的社区参考值,而非该模型在 RTX 5090 上的官方极限。

如何看待这一数据

对计划在本地部署 Qwen3 系列模型的开发者而言,这则帖子提供了一个直观锚点:开启 MTP 后,30B 级别的 MoE 模型已可在消费级旗舰卡上实现接近实时对话的生成速度。但需要注意:

  • 数据来自单一用户的单次测试,未与其他框架(如 llama.cpp、vLLM、ExLlamaV2)做横向对比;
  • 缺少 prompt 长度、KV cache 设置、量化方案(如 Q4_K_M、AWQ、FP8)等上下文信息,速度难以复现;
  • MTP 在不同模型、不同框架下的加速比差异较大,85.6 tok/s 仅对该帖具体配置成立。

如需更可靠的对比结论,仍建议参考官方发布的 benchmark 或自行在统一环境下复测。

信源