桃子桃子快讯
返回首页
工具

玩家用 RTX 5090 + 5060 Ti 本地跑通 2.4T 参数 Qwen3 MoE

Reddit 用户在 RTX 5090 + RTX 5060 Ti 上以约 0.8 tok/s 本地推理 2.4T 总参…

2026.08.14 · 周五4 分钟阅读

Reddit 用户 mossy_troll_84 在 r/LocalLLaMA 发布实验记录,使用 llama.cpp(Unsloth 构建版 10360)在 Arch Linux 工作站上本地加载并运行 Qwen3.8-2.4T-A95B 的 UD-Q1_0 GGUF 量化权重。该模型总参数量约 2.45T,采用 512 个路由专家、每 token 激活 10 个的 MoE 架构,完整 GGUF 文件约 397 GiB。整套配置在消费级硬件上实现了约 0.80 tok/s 的生成速度,并成功启用模型的原生 MTP(Multi-Token Prediction)推测解码。

硬件与运行环境

  • CPU:AMD Ryzen 9 9950X3D,16 核 32 线程
  • GPU 0:NVIDIA RTX 5090,32 GB VRAM
  • GPU 1:NVIDIA RTX 5060 Ti,16 GB VRAM
  • 内存:128 GB DDR5 5600 CL36
  • Swap:350 GB
  • 操作系统:Arch Linux
  • 推理框架:llama.cpp Unsloth 构建(版本 10360)

模型加载采用张量拆分 --tensor-split 4,1,并通过 --n-cpu-moe 91 将 91 层 MoE 专家卸载至 CPU;block 92 的专家权重也被强制保留在 CPU 上,以避免 MTP 阶段耗尽 VRAM。MTP 草稿解码使用 RTX 5090(CUDA0)执行。

MTP 推测解码调优

作者围绕 MTP 的 n_maxp_min 两个关键参数做了多轮对比测试,得到以下经验值:

  • n_max=2:过于保守
  • n_max=3:综合最优
  • n_max=4:开销显著增加,整体变慢
  • p_min=0.0:草稿 token 质量差,接受率低
  • p_min=0.5:平衡最好,被最终采用
  • p_min=0.7:草稿接受率达到 100%,但有效草稿数过少,反而更慢

最终配置:--spec-draft-n-max 3--spec-draft-p-min 0.5,MTP 草稿在 RTX 5090 上执行并启用 CPU MoE 卸载。

性能实测

在受控的 32 token 生成测试中(16 token prompt,32 token 输出):

  • 启用 MTP:生成速度 0.8033 tok/s,解码耗时 39.84 s,总墙钟 59.14 s
  • 不启用 MTP:生成速度 0.7750 tok/s,解码耗时 41.29 s,总墙钟 60.81 s
  • MTP 草稿 token 数:21,接受数 19,接受率 90.48%

相对基线,MTP 带来约 +3.64% 的生成吞吐与 -2.74% 的总墙钟时间。生成结束后显存占用约为:

  • RTX 5090:29.6 GB / 剩余约 2.6 GB
  • RTX 5060 Ti:12.3 GB / 剩余约 3.6 GB

适用范围与局限

作者明确指出 0.80 tok/s 来自单一受控测试,并非通用 benchmark。实际速度会受 prompt 长度、上下文大小、输出分布与专家路由策略影响。ctx-size 512--fit on --fit-target 2048,1536 等参数意味着当前配置并未追求长上下文。即便如此,能在两块消费级显卡上跑通 2.4T 总参数的 MoE 模型,并稳定启用原生 MTP 推测解码,对本地推理社区仍是一次有参考价值的验证。

信源