桃子桃子快讯
←返回首页
开源

社区实测:Qwen3 Flash-Next IQ4_XS 多项基准反超 27B FP8

Reddit 用户用 vLLM 在 64GB DDR5 + 双 R9700 上对比 Qwen3 Flash-Next I…

2026.09.25 · 周五约 3 分钟阅读

一位 Reddit 网友在 r/LocalLLaMA 板块分享了对 Qwen3 系列两个版本的本地实测结果:Qwen3 Flash-Next IQ4_XS(经 vLLM 与 ROCm/AMD 路径加载)与 Qwen3.8 27B FP8(同样经 vLLM 加载,但走 Radiance 后端)。测试平台为 64GB DDR5 内存搭配两张 AMD R9700 显卡,并非官方基准,但给出了明确的量化对比数字。

主要基准结果

在 5 项常见基准测试中,Flash-Next IQ4_XS 在 4 项上领先或追平 27B FP8:

  • MMLU-Pro:83.8%(Flash-Next)vs 75.0%(27B FP8)
  • GPQA Diamond:42.5% vs 27.5%
  • GSM8K:97.5% vs 90.0%
  • German MGSM:92.5% vs 90.0%
  • IFEval:89.6% vs 89.6%(持平)

作者特别说明,这一结果与坊间「FP8 27B 强于低量化 Flash-Next」的常见说法并不一致,从他个人的日常使用感受和本次评估来看,量化版本并未显示出明显能力退化。

推理速度与并发

在速度层面,FP8 27B 明显占优:250 条「fast」试用案例完成时间分别为 36 分 27 秒(FP8 27B)与 2 小时 05 分 47 秒(Flash-Next IQ4_XS),FP8 大约快 3.4 倍。作者表示,如果升级到 128GB DDR5 并使用社区 tcclaviger 提供的 mxfp4 量化版本,Flash-Next 速度有望再提升约 2 倍。

并发方面,作者指出在他的系统上 FP8 27B 的并发吞吐大约是 Flash-Next 的 4 倍,因此多用户场景下 FP8 仍是更优选择。

测试细节与局限

作者使用 Codex 协助完成评测,单次完整 benchmark 耗时约 2 小时,更完整的下一轮迭代预计超过 8 小时,目前尚未跑完。测试时使用的 ROCm/vLLM 相关驱动(R9V)尚未包含最新更新,硬件为消费级 AMD 平台。作者也公开征求更具有区分度的 benchmark 推荐,以便后续进一步对比。

整体来看,这是一份典型的本地 LLM 爱好者横向对比:数据具体、硬件透明、结论明确——单用户场景下低量化 Flash-Next 在能力上不输甚至略胜 FP8 27B,但速度与并发仍是 FP8 的优势。

信源