Ling-3.0-flash INT4 在 DGX Spark 上提速近一倍
inclusionAI 工程师分享两条 vLLM 配置改动,将官方 INT4 在单卡 DGX Spark 上的推理速度从…
inclusionAI 的 Ling 团队成员近日在 Reddit r/LocalLLaMA 分享了一项针对 NVIDIA DGX Spark 单机的推理优化方案:仅调整两条 vLLM 启动参数,便可将官方 Ling-3.0-flash INT4 模型的生成速度从默认的 20.8 tok/s 提升至 38.7 tok/s,性能几乎翻倍。该数据来自社区用户 sudoingX 在 X 平台公开发布的实测结果,作者经其授权转发。
两条关键配置改动
提升来自两项设置的调整。第一,移除 --enforce-eager 参数,让 CUDA Graph 真正生效;第二,开启 MTP(Multi-Token Prediction)投机解码,指定 Ling 仓库内已内置的草稿层:
- 投机解码配置示例:
--speculative-config '{"method": "bailing_hybrid_v3_mtp", "num_speculative_tokens": 1}'
按上述方式配置后,官方 INT4 量化版本在同一台 DGX Spark 上的速度反超社区常用的 Q5 GGUF 版本(38.7 vs 35.2 tok/s),并能完整支撑 256K 上下文窗口。
必须使用专用 fork
比速度更值得警惕的是正确性问题。原版 vLLM 尚未支持 Ling V3 架构,运行时会走错误的注意力路径而不会报错,模型仍会输出流畅文本,直到某个位置突然出现异常。因此需要使用 inclusionAI 专门维护的 fork:
- 仓库地址:
inclusionAI/vllm-ling-v3,分支ling_3_0
该 fork 提供完整的 serve 脚本、冷启动 shard 卡死的 watchdog、benchmark 方法以及记录全部数据的 FINDINGS.md。
上下文长度与取舍
作者也指出一个使用场景上的权衡:INT4 版本在 30K 以内的上下文区间速度最快,而社区 Q5 GGUF 在超长上下文(长对话马拉松式推理)下衰减更平缓。用户可根据自身负载选择量化方案。
开源与复现
完整的部署脚本、压测方法与原始数据已开源在 sudoingX/dgx-spark-ling 仓库。作者也邀请拥有 DGX Spark 的用户在评论中反馈自己的实测结果,以便持续校准这些数字。
