Ling-3.0-flash 124B 在单台 DGX Spark 稳定解码 35.68 tok/s
用户测试显示 Ling-3.0-flash 124B 以 Q5 GGUF 量化在单台 DGX Spark 上生成 151…
一位自称在 inclusionAI 参与 Ling 模型的开发者 sudoingX 在 X 上分享了一次推理吞吐实测:他在一台 NVIDIA DGX Spark 上运行社区版的 Ling-3.0-flash(Q5 GGUF 量化),仅启动 Web UI 和 llama-server,未跑其他负载,给出 33 token 的提示词让模型生成一个带模拟数据的 GPU 监控仪表盘前端,随后离开。模型最终在一次响应中连续生成 15128 token,全程耗时约 424 秒,平均解码速度约 35.68 token/秒。
关键性能数据
- 模型:Ling-3.0-flash,124B 参数
- 硬件:单台 NVIDIA DGX Spark,机器上仅有 Xorg 在运行
- 量化:社区 Q5 GGUF
- 输入提示词长度:33 token
- 单次响应输出:15128 token,未截断
- 总耗时:424035.62 ms(约 7 分 04 秒)
- 平均解码速度:35.68 token/秒,每 token 28.03 ms
解码速度全程稳定
更值得注意的不是总输出量,而是 KV 缓存随 token 数膨胀时解码速度几乎不变:日志显示在第 2793 个解码 token 时速度为 35.62 token/秒,到第 15062 个 token 时仍为 35.68 token/秒。中间多生成了一万两千多个 token,速度仅浮动 0.06 token/秒,说明在 Q5 量化、124B 规模下,该硬件与推理栈的 KV 缓存管理表现平稳,没有出现常见的解码速度随上下文增长而下降的问题。
输出内容与局限
按提示词要求,模型生成的是一个以前端代码为主的仪表盘,使用 Math.random() 模拟漂移数据,并显示两台该机器并不存在的 GPU。原帖作者指出,提示词中已明确写有「dummy」一词,模型据此生成了模拟数据,并未真正读取本机 GPU;输出能否正确渲染未做进一步一致性验证。他本人在贴中强调这是一次「吞吐观察而非功能演示」。
社区参考意义
DGX Spark 是 NVIDIA 面向桌面端的大显存推理设备,本次实测提供了 124B 级别模型在该平台上以 GGUF 量化跑长输出的具体数据点,对评估本地部署 Ling-3.0-flash 或类似规模模型时的吞吐与显存压力有一定参考价值。但该结果来自社区用户的一次非标准化测试,并非厂商官方基准,结论应视为单点观察。
