工具
Qwen3 8B 新 NVFP4 量化发布,Blackwell 上预fill 提速 50%
社区推出针对 Blackwell GPU 优化的 Qwen3 8B NVFP4 量化版本,RTX 5090 上预fill…
2026.08.21 · 周五约 2 分钟阅读
一名社区开发者发布了针对 Qwen3 8B 的全新 NVFP4 量化 GGUF,主打「Blackwell 原生 + 预fill 优化」。在兼容硬件上,该量化相比同显存占用的 Q4 版本预fill 速度提升约 50%,相比同类 NVFP4 量化再快 4–7%。该 GGUF 还附带量化后的 MTP 草稿头,并提供可使 MTP 再提速 15% 的推荐参数。
基准表现
测试平台为 RTX 5090 32GB,衡量 prompt 长度 2048 时的预fill 吞吐(单位 tokens/s):
- 本次发布 NVFP4:6250 t/s
- Unsloth NVFP4:6010 t/s
- Q4_0:4130 t/s
- Q6_K:3210 t/s
相较 Unsloth 已有的 NVFP4 版本,新版本领先约 4%;相较同等显存占用的传统 Q4_0 量化,速度高出约 51%。需要注意的是,Q6_K 虽然精度更高,但速度明显落后,印证了「体积与速度并不总是正相关」。
关键特性
- Blackwell 原生:kernel 选择针对 Blackwell 架构新 Tensor Core 设计,而非回退兼容旧卡。
- 预fill 优化:重点提升长 prompt 批量推理的吞吐,对生成阶段(decode)增益相对有限。
- MTP 草稿头量化:内置量化版 Multi-Token Prediction 草稿头,可配合投机解码使用;按推荐设置可额外带来约 15% 的吞吐提升。
适用范围与局限
该量化主要服务于在 Blackwell 级硬件(RTX 5090 等)上本地部署 Qwen3 8B 的用户,特别是 prompt 较长、偏重预fill 的工作负载。在 Ampere 及更早架构上无法获得 NVFP4 专属加速,需要回退到 Q4/Q6 等通用格式。该版本基于社区个人测试,未经过大规模复现验证,建议生产场景自行复核。
获取方式
GGUF 文件与推荐参数详见 r/LocalLLaMA 由 u/ionsago 发布的原帖。
