桃子桃子快讯
返回首页
行业动态

社区基准:Qwen3.8-Flash-Next NVFP4 在 RTX Pro 6000 上编程任务表现亮眼

Reddit 用户 WonderRico 测试 Qwen3.8-Flash-Next NVFP4 量化版,在 agent…

2026.08.29 · 周六2 分钟阅读

Reddit 用户 WonderRico 在 r/LocalLLaMA 板块发布了一项本地大模型 agentic coding(智能体式编程)基准测试结果,参测对象为社区量化版本 Qwen3.8-Flash-Next NVFP4。结果显示,该模型在作者自建基准上取得了其测试过的所有本地模型中「几乎最高」的分数,同时在单位得分所需请求数和生成 token 数两项效率指标上均为最低(即最高效),并且推理速度极快。

核心结论

作者在其维护的编程类基准上对多个本地模型进行了对比,Qwen3.8-Flash-Next NVFP4 的主要表现为:

  • 得分:在作者测试过的所有本地模型中接近最高
  • 效率:单位得分所需请求数与生成 token 数均最少
  • 推理设置:使用 medium reasoning 即可达到上述成绩;切换至 xhigh 在该基准上「再次」未带来明显提升
  • 速度:响应极快

作者额外说明,该模型仍处于「训练不充分」(undertrained)状态,意味着得分还有继续上探的空间。

测试环境与方法

  • 量化格式:NVFP4(NVIDIA FP4)
  • 硬件:单张 RTX Pro 6000
  • 任务类型:agentic coding,多轮工具调用与代码生成
  • 对照样本:dealignai/Qwen3.8-Flash-Next-UNCENSORED-NVFP4 因属「随机」去审查版本,得分明显偏低

完整的对比图表与逐项数据托管于作者的 benchmark 网站(wonderrico.github.io/local_llm_benchmark),原帖正文未直接列出具体数值。

需要注意的局限

  • 「Qwen3.8-Flash-Next」并非 Qwen 官方发布的正式型号名称,疑为社区微调或特定配置下的衍生版本,具体来源与训练细节尚不清晰
  • 测试由社区用户独立完成,软硬件配置具有较强特异性,结论未必能直接迁移到其他显卡或推理框架
  • 详细 benchmark 数据依赖外部链接站点访问,正文信息密度有限
  • 作为去审查版本(UNCENSORED)的对照组,得分差异说明该量化变体的能力受微调路径影响较大

如需横向比较具体分数与图表,建议直接查阅作者维护的基准页面。

信源