工具
通义 Qwen 推送 NVFP4 与 DFlash2 推理配置至 SGLang
Qwen 官方宣布为 SGLang 框架新增 NVFP4 量化与 DFlash2 推测解码配置,覆盖 Qwen3 系列模…
2026.08.21 · 周五约 3 分钟阅读
通义千问 Qwen 团队近日通过官方 X 账号宣布,已将 NVFP4 量化与 DFlash2 推测解码两条新「配方(recipes)」同步至 SGLang 官方 Cookbook,供社区开发者直接取用。此次更新面向基于 NVIDIA Blackwell 架构部署 Qwen3 系列模型的推理场景。
更新要点
- 新增 NVFP4 量化方案:NVFP4 是 NVIDIA 面向 Blackwell GPU 推出的 4 位浮点量化格式,相比传统的 INT4 或 FP8 路径,可在保持模型精度的同时进一步压缩显存占用并提升吞吐。
- 新增 DFlash2 推测解码:DFlash2 是一类轻量级草稿模型驱动的推测解码(speculative decoding)实现,能够在不改输出分布的前提下加速自回归生成。
- 集成入口位于 SGLang Cookbook:两条配置作为可直接复用的「recipe」放进 SGLang 项目文档,开发者无需自行拼装参数即可在部署中启用。
适用场景与限制
- 硬件依赖:NVFP4 路径依赖 Blackwell 架构(NVIDIA B 2024 及更新 GPU),在 Hopper 或更早卡上需回退到 FP8 / INT4 方案。
- 模型范围:官方仅以 Qwen3 系列中参数量约 27B 的变体作为示例,社区可参照 Cookbook 模板适配其他尺寸的 Qwen3 检查点。
- 框架绑定:配置针对 SGLang 推理框架编写,使用 vLLM、TGI 或其他推理后端的用户需自行迁移参数。
行业背景
SGLang 是当前主流的开源 LLM 推理服务框架之一,强调高吞吐与低延迟,社区活跃度高。NVFP4 与推测解码的组合是 2025 年以来大模型推理侧的重要优化方向:前者来自 NVIDIA 在低精度数值格式上的硬件-软件协同设计,后者则通过「小模型先猜、大模型复核」的方式显著降低自回归步骤数。两者叠加通常能在对话与长文本生成任务上取得 1.5–3 倍不等的吞吐提升(具体数值取决于模型与硬件配置)。
后续关注点
目前官方仅给出 Cookbook 链接与简要说明,尚未披露在 Qwen3 全系列模型上的标准 benchmark 数据(如 tokens/s、TTFT、首字延迟)。建议关注 SGLang 与 Qwen 后续是否补充:
- 不同尺寸 Qwen3 模型在 NVFP4 下的精度损失对比;
- DFlash2 草稿模型的来源与训练方式;
- 端到端在 H100 / B200 上的实测吞吐曲线。
对正在使用或评估 SGLang + Qwen 组合的工程团队而言,这两条 recipe 提供了低成本的优化起点,值得在正式部署前完成一轮回归测试。
