玩家用 RTX 5090 + 5060 Ti 本地跑通 2.4T 参数 Qwen3 MoE
Reddit 用户在 RTX 5090 + RTX 5060 Ti 上以约 0.8 tok/s 本地推理 2.4T 总参…
Reddit 用户 mossy_troll_84 在 r/LocalLLaMA 发布实验记录,使用 llama.cpp(Unsloth 构建版 10360)在 Arch Linux 工作站上本地加载并运行 Qwen3.8-2.4T-A95B 的 UD-Q1_0 GGUF 量化权重。该模型总参数量约 2.45T,采用 512 个路由专家、每 token 激活 10 个的 MoE 架构,完整 GGUF 文件约 397 GiB。整套配置在消费级硬件上实现了约 0.80 tok/s 的生成速度,并成功启用模型的原生 MTP(Multi-Token Prediction)推测解码。
硬件与运行环境
- CPU:AMD Ryzen 9 9950X3D,16 核 32 线程
- GPU 0:NVIDIA RTX 5090,32 GB VRAM
- GPU 1:NVIDIA RTX 5060 Ti,16 GB VRAM
- 内存:128 GB DDR5 5600 CL36
- Swap:350 GB
- 操作系统:Arch Linux
- 推理框架:llama.cpp Unsloth 构建(版本 10360)
模型加载采用张量拆分 --tensor-split 4,1,并通过 --n-cpu-moe 91 将 91 层 MoE 专家卸载至 CPU;block 92 的专家权重也被强制保留在 CPU 上,以避免 MTP 阶段耗尽 VRAM。MTP 草稿解码使用 RTX 5090(CUDA0)执行。
MTP 推测解码调优
作者围绕 MTP 的 n_max 与 p_min 两个关键参数做了多轮对比测试,得到以下经验值:
n_max=2:过于保守n_max=3:综合最优n_max=4:开销显著增加,整体变慢p_min=0.0:草稿 token 质量差,接受率低p_min=0.5:平衡最好,被最终采用p_min=0.7:草稿接受率达到 100%,但有效草稿数过少,反而更慢
最终配置:--spec-draft-n-max 3,--spec-draft-p-min 0.5,MTP 草稿在 RTX 5090 上执行并启用 CPU MoE 卸载。
性能实测
在受控的 32 token 生成测试中(16 token prompt,32 token 输出):
- 启用 MTP:生成速度 0.8033 tok/s,解码耗时 39.84 s,总墙钟 59.14 s
- 不启用 MTP:生成速度 0.7750 tok/s,解码耗时 41.29 s,总墙钟 60.81 s
- MTP 草稿 token 数:21,接受数 19,接受率 90.48%
相对基线,MTP 带来约 +3.64% 的生成吞吐与 -2.74% 的总墙钟时间。生成结束后显存占用约为:
- RTX 5090:29.6 GB / 剩余约 2.6 GB
- RTX 5060 Ti:12.3 GB / 剩余约 3.6 GB
适用范围与局限
作者明确指出 0.80 tok/s 来自单一受控测试,并非通用 benchmark。实际速度会受 prompt 长度、上下文大小、输出分布与专家路由策略影响。ctx-size 512、--fit on --fit-target 2048,1536 等参数意味着当前配置并未追求长上下文。即便如此,能在两块消费级显卡上跑通 2.4T 总参数的 MoE 模型,并稳定启用原生 MTP 推测解码,对本地推理社区仍是一次有参考价值的验证。
