桃子桃子快讯
返回首页
开源

DeepSeek V4 Flash 与 GLM 5.3 Flash 双卡 DGX Spark 实测对比

用户在 2 张 DGX Spark 上对比 DeepSeek V4 Flash 0731 与 GLM 5.3 Flash…

2026.08.30 · 周日4 分钟阅读

Reddit 用户 serige 在双 NVIDIA DGX Spark(GB10 Grace Blackwell,统一内存)平台上,对 DeepSeek V4 Flash 0731 与 GLM 5.3 Flash 两款开源权重模型进行了 HumanEval 编程基准实测。结果显示,搭载 NVFP4 量化的 GLM 5.3 Flash 在开启高强度思考模式时,HumanEval Pass@1 达到 97%,略高于 DeepSeek 同模式的 94.5%,但代价是上下文窗口收窄至 256k。

测试配置

  • 硬件平台:2 张 NVIDIA DGX Spark(GB10,每张 128GB 统一内存)
  • DeepSeek V4 Flash 0731:官方检查点,FP8 KV cache,1M 上下文,4 路并发
  • GLM 5.3 Flash:NVFP4 量化,FP8 E4M3 KV cache,256k 上下文,6 路并发

两模型均测试两种推理模式:高强度「思考模式」与关闭思考的「直接零样本」。

核心成绩

  • GLM 5.3 Flash(NVFP4 + 思考模式高):HumanEval Pass@1 为 97.0%(159/164),HumanEval+ 92.1%(151/164),测试用时 20 分 52 秒,生成速度约 50 tok/s(DFlash2 解码)
  • DeepSeek V4 Flash 0731(思考模式高):HumanEval Pass@1 94.5%(155/164),HumanEval+ 88.4%(145/164),用时 38 分 16 秒,生成速度约 70 tok/s(推测解码 MTP-5)
  • GLM 5.3 Flash(直接零样本):HumanEval 93.3%(153/164),HumanEval+ 89.6%(147/164),用时 23 分 32 秒
  • DeepSeek V4 Flash 0731(直接零样本):HumanEval 92.7%(152/164),HumanEval+ 87.8%(144/164),用时仅 14 分 52 秒

关键观察

  • 思考模式下 GLM 5.3 Flash 的 raw 分数优于 DeepSeek V4 Flash 0731;97% 的 Pass@1 在不久之前还属 SOTA 水平,且当前并非最高思考档位
  • 量化损失有限:作者引用此前 Unsloth 公布的 Q4 量化准确率约 92%,NVFP4 此次跑出 97%,明显更优
  • 主要权衡是上下文长度:DeepSeek 支持 1M,GLM 仅 256k;显存达 512GB 以上(即 4 卡 Spark)用户可运行 GLM 的 FP8 全精度版本以恢复长上下文
  • 生成速度差异:DeepSeek 的 MTP-5 推测解码比 GLM 的 DFlash2 快约 40%,直接零样本模式下用时差距最为悬殊

结论与提醒

作者在结尾强调,基准测试只是参考,硬件配置、量化方案与工程优化都会显著影响实际推理体验,建议读者结合自身硬件与负载自行复现验证。该帖子面向正在纠结 2x DGX Spark 该跑哪款模型的本地部署用户,社区反馈显示不少人在 NVFP4 上对 GLM 持保留意见,本次数据则给出了相对积极的实测结果。

信源