开源
Ling-3.0-flash 量化测试:单卡全档速度几乎持平
在 DGX Spark 上实测 Ling-3.0-flash 各级 GGUF 量化,推理速度稳定在 32–40 tok/…
2026.08.12 · 周三约 2 分钟阅读
近日,社区用户在 NVIDIA DGX Spark 单机上对 inclusionAI 旗下 Ling-3.0-flash 模型的完整 GGUF 量化阶梯进行了实测,结果显示整条量化梯度在解码速度上几乎贴近,覆盖 32–40 tok/s 的窄区间。该测试由 X 用户 sudoingX 完成,并经 Ling 团队成员授权发布。
各档量化实测数据
测试聚焦单流解码(single stream decode),覆盖社区常用的几个 GGUF 量化档位:
- Q5_K_M:40.2 tok/s,整档最快且接近无损;
- Q4_K_M:38.2 tok/s,显存占用最小;
- Q6_K:32.0 tok/s,品质最高但比峰值低约 16%。
最高与最低档之间仅相差约 8 tok/s,差距并不明显。这一表现与传统稠密模型形成鲜明对比——通常降低比特宽度会换来可观的吞吐提升。
MoE 架构是速度扁平化的主因
Ling-3.0-flash 是一个稀疏激活的 MoE 模型,总参数 124B,但每 token 仅激活约 5.1B 参数。由于参与推理的参数极少,量化带来的显存与计算收益被摊薄,导致不同档位之间的速度差异几乎被抹平。
值得一提的是,Q5_K_M 同时占据了「最快」与「近无损」两个标签,省去了用户在品质与速度之间做取舍的过程。
同硬件横向对比
在同一台 DGX Spark 上,sudoingX 还测试了 DeepSeek V4 Flash,其解码速度为 16.5 tok/s。Ling-3.0-flash 的 Q5_K_M 档约为其 2.4 倍,即便是最高画质档 Q6_K 也能接近 2 倍。
这一对比进一步凸显了 MoE 模型在低激活条件下的吞吐优势,也为本地部署玩家提供了选型参考。
备注与后续
原作者表示图表数据来源于 sudoingX,并邀请其他拥有 DGX Spark 的用户在评论区补充实测曲线,以验证该量化–速度曲线的一致性。
