行业动态
社区基准:Qwen3.8-Flash-Next NVFP4 在 RTX Pro 6000 上编程任务表现亮眼
Reddit 用户 WonderRico 测试 Qwen3.8-Flash-Next NVFP4 量化版,在 agent…
2026.08.29 · 周六约 2 分钟阅读
Reddit 用户 WonderRico 在 r/LocalLLaMA 板块发布了一项本地大模型 agentic coding(智能体式编程)基准测试结果,参测对象为社区量化版本 Qwen3.8-Flash-Next NVFP4。结果显示,该模型在作者自建基准上取得了其测试过的所有本地模型中「几乎最高」的分数,同时在单位得分所需请求数和生成 token 数两项效率指标上均为最低(即最高效),并且推理速度极快。
核心结论
作者在其维护的编程类基准上对多个本地模型进行了对比,Qwen3.8-Flash-Next NVFP4 的主要表现为:
- 得分:在作者测试过的所有本地模型中接近最高
- 效率:单位得分所需请求数与生成 token 数均最少
- 推理设置:使用 medium reasoning 即可达到上述成绩;切换至 xhigh 在该基准上「再次」未带来明显提升
- 速度:响应极快
作者额外说明,该模型仍处于「训练不充分」(undertrained)状态,意味着得分还有继续上探的空间。
测试环境与方法
- 量化格式:NVFP4(NVIDIA FP4)
- 硬件:单张 RTX Pro 6000
- 任务类型:agentic coding,多轮工具调用与代码生成
- 对照样本:dealignai/Qwen3.8-Flash-Next-UNCENSORED-NVFP4 因属「随机」去审查版本,得分明显偏低
完整的对比图表与逐项数据托管于作者的 benchmark 网站(wonderrico.github.io/local_llm_benchmark),原帖正文未直接列出具体数值。
需要注意的局限
- 「Qwen3.8-Flash-Next」并非 Qwen 官方发布的正式型号名称,疑为社区微调或特定配置下的衍生版本,具体来源与训练细节尚不清晰
- 测试由社区用户独立完成,软硬件配置具有较强特异性,结论未必能直接迁移到其他显卡或推理框架
- 详细 benchmark 数据依赖外部链接站点访问,正文信息密度有限
- 作为去审查版本(UNCENSORED)的对照组,得分差异说明该量化变体的能力受微调路径影响较大
如需横向比较具体分数与图表,建议直接查阅作者维护的基准页面。
