桃子桃子快讯
返回首页
工具

DGX Spark 实测:四款新模型本地部署性能对比

Reddit 用户在四台 DGX Spark 上实测 DeepSeek V4 Flash、Qwen3.8 Flash N…

2026.08.29 · 周六5 分钟阅读

一位 Reddit 用户在 r/LocalLLaMA 板块分享了在四台 NVIDIA DGX Spark(共两组 ConnectX-7)上对 DeepSeek V4 Flash、Qwen3.8 Flash Next、Qwen3.8-27B 与 Qwen3.6-35B-A3B 四款模型的本地部署实测,覆盖推理吞吐、长上下文与思维档位(thinking level)等多种场景。所有数据均为实测、非模型卡抄录。

测试环境与运行配置

四台 Spark 组成两组 ConnectX-7 配对,分别承担不同模型的部署:

  • DeepSeek V4 Flash 0731:2x Spark + TP2,vLLM 后端,NVFP4 精度,启用 MLA KV cache 与 DSpark MTP5 speculative,实测通过约 89.99 万 token 的 prompt,最长演示上下文接近 1,048,576。
  • Qwen3.8 Flash Next:2x Spark + TP2,SGLang 后端,启用 QSA、NEXTN 与 FlashInfer GDN,最长上下文 262,144。
  • Qwen3.8-27B:1x 或 2x Spark,SGLang + DFlash2 K8 + FP8 KV。
  • Qwen3.6-35B-A3B:1x Spark,vLLM + Marlin MoE + DSpark K8 + FP8 KV。

测试使用 12 题 lcb_generation 加 12 题 coding_completion,四个并发 API 请求、streaming、不启用工具,并关闭网络以保证执行评分一致性。吞吐指标采用整批 wall time(含 prefill、调度、推理和尾部失败)除以 API 账户输出 token,因此并非纯 decode-only 速度。

主要吞吐与质量结果

整体看,Flash Next 在思维档位 off 时完成全批最快(1 分 22 秒),DeepSeek V4 Flash 在 low 档下耗时 25 分 9 秒且生成了 2.65 倍于 Qwen27 low 的输出 token:

  • Flash Next medium 得分 22/24 为最佳单次跑分;low 档 21/24 是日常更均衡的选择。
  • Flash Next off 在 1:22 完成 24 题且输出极为精简,对应 107.7 tok/s delivered。
  • Qwen27 low 多答对一题但耗时是 off 档的 3.82 倍,且单条响应触及 32K 上限。
  • DeepSeek V4 Flash low 主价值不在速度,而在其单独演示的约 90 万 token 长 prompt 能力。
  • xhigh/high 思维档位 在本批测试中反而带来更长耗时和更差得分(Flash Next xhigh 用三倍 medium token 数却分数更低;DeepSeek high 同样更差)。

并发方面,几款模型在固定输出长度下表现稳定:Qwen3.8-27B 在 2 个独立 Spark 副本 c16 时达到 286.93 tok/s 聚合、2x Spark TP2 c12 达 199.98 tok/s;Qwen3.6-35B-A3B 单卡 c16 即冲到 404.89 tok/s,c32 出现排队后回落至 382.64 tok/s。

长上下文与 speculative decoding

DeepSeek V4 Flash 的约 80 tok/s 头条数字只在 forced-decode、可被 speculative 高接受率的场景中成立;同一现场配方在自由生成时仅约 42 tok/s。作者明确指出,仅报告 80 tok/s「技术上没错,但运维上会误导」。对 Flash Next 关闭 NEXTN 后,c1 仅 26.4 tok/s、c6 聚合 111.8 tok/s;启用 NEXTN 使单流提升约 1.9 倍,c6 吞吐提升约 1.65 倍。

拓扑对比与运维启示

针对 Qwen3.8-27B 的拓扑对比显示:TP2 让单条长编码流从 65.51 提到 100.08 tok/s(1.53 倍),但在饱和时两个独立副本的聚合吞吐比 TP2 高约 43%(c8 下 157.38 vs 124.58 tok/s),且能隔离失败。TP2 的优势在低并发单流,c12 才达到 199.98 tok/s 这一较有用饱和点;c16 已出现排队。作者总结这些差异是「部署运行点」,而非单一架构归一化榜单——prompt 形状与输出长度不一致,不同模型的 native 配方之间不能直接排名。

信源