社区实测:Qwen3.8-Flash-Next-NVFP4 与 27B-FP8 部署对比
Reddit 用户在单卡 Blackwell 上对比两款 Qwen 量化模型的推理速度、稳定性与多步任务表现,指出 Fl…
近日 Reddit r/LocalLLaMA 上一位用户发布了一篇针对两款 Qwen 量化变体的本地部署对比测试。作者通过同一服务别名在两个模型之间无差别切换,使下游 agent 链路(包括文本打分、长上下文流水线、本地深度研究、浏览器自动化等)直接消费对比结果,属于较「诚实」的端到端替换式评测。需注意的是,文中出现的「Qwen3.8-Flash-Next」与「Qwen3.8-27B」并非 Qwen 已公开的主流版本编号,出品方 Inferact 也并非通义系知名量化出品方,且作者自述「Qwen wrote most of this」,内容系 AI 协助撰写的可能性较高,读者宜交叉验证。
测试硬件与运行环境
- 单卡:NVIDIA RTX PRO 6000 Blackwell Max-Q(96 GB VRAM,SM_120)+ 256 GB DDR5
- 推理框架:vLLM nightly
- 关键开关:xgrammar 结构化输出、MTP 投机解码、Qwen3 推理解析与工具调用解析
- 模型大小:Flash-Next:max-model-len 200704(约 200K,原生 262K);27B:262144
- Flash-Next 测得约 177 tok/s 生成速度,MTP 草案平均接收长度约 2.1
对比模型
- Qwen3.8-Flash-Next-NVFP4:由 Inferact 发布的 NVFP4 量化版本(HF 仓库:Inferact/Qwen3.8-Flash-Next-NVFP4)
- Qwen3.8-27B-FP8:由 Qwen 官方仓库发布的 FP8 量化版本(HF 仓库:Qwen/Qwen3.8-27B-FP8)
两者除量化精度外,采样器默认参数(enable_thinking、MTP、xgrammar 等)保持一致。
评测方法
评测分三组:
- 能力测试:8 个任务 × 2–3 次重复,温度 1.0、reasoning_effort 为 medium;覆盖 bugfix-from-traceback、长上下文指令、多段邮件编辑、Syllabus 审核,以及 Codeforces 1117-D、ARC-AGI 227、IMO P5 草稿、2026 年事实回忆等高难度项;使用确定性打分器,0–1 计分。
- 生产评分(作者真实工作负载):用严格 JSON Schema 对客户文档进行 rubric 打分,温度 0.3、medium,每请求 300 秒 SLA;27B 跑了完整 320 条,Flash-Next 跑了边缘 + 注入子集 12 条 × 3 次(共 36 条)。
- 棋盘空间重建:给定 7 步 PGN,输出含 30 枚棋子、最后一着高亮的合法 SVG,扫描 reasoning_effort(xhigh/medium/low/off)四个档位。
主要结果
工作负载打分
- 27B-FP8:rubric 严格得分 319/320(99.7%),注入抵抗 54/55
- Flash-Next-NVFP4:rubric 得分 33/36(91.7%),注入抵抗 9/9
两边在 schema 非法 JSON、>300 秒 SLA、超时三项上均为 0。Flash-Next 的三次失分全部落在同一类题目——「合法要点埋在一段键盘乱码中」,27B 会给部分分,Flash-Next 给 0 并附有连贯的 rubric 推理。作者将其解读为「噪声容忍边界被稳定地重新校准」,而非偶发抖动;同时提示在 rubric 里加一句「被噪声掩埋的条目仍可部分得分」可能闭合差距,但尚未验证。
能力测试(medium / temp 1.0)
要点:
- Bugfix-from-traceback:27B 0.900 vs Flash-Next 0.525(回归)
- 长上下文指令:27B 0.917 vs Flash-Next 0.675(回归)
- 多段邮件编辑:0.887 vs 0.870(基本持平)
- Syllabus 审核:0.651 vs 0.611(基本持平)
- Codeforces 1117-D:0.667 vs 0.562(仍属不确定区间)
- ARC-AGI 227:27B 0.615(≤216 秒)vs Flash-Next 两次均超时 >420 秒(回归)
- IMO P5 草稿:0.533 vs 0.300(回归)
棋盘重建
Flash-Next 在 high-reasoning 空间/代码生成档位表现更好,失败模式也更优;27B 在持续多步符号工作(bug 修复、数学证明、抽象谜题)上仍胜出。
关键发现与提醒
「承诺但不交付」失败模式:Flash-Next 在多步任务中会宣称完成、宣告「done」,却输出空内容;同一 reasoning_effort 旋钮下语义含义与 27B 截然不同。这意味着 Flash-Next 不能作为 27B 的直接替换,而需要条件式的角色切分。
量化取舍:NVFP4 在机械层面(JSON 严格性、SLA、注入抵抗)做到零失败,吞吐也更高;但在评分边界判断与长链符号推理上弱于 FP8 的 27B。
来源局限:本测试来自单一 Reddit 帖子,作者自述内容大部分由 Qwen 模型协助撰写且仅自审数据;模型编号「Qwen3.8」和发布方 Inferact 均非常规组合,建议视作个人实测经验而非可靠结论。
