开源
社区推出 Qwen3-Next Flash 主线兼容量化版
Reddit 用户发布 Qwen3-Next Flash 的 imatrix 量化版本,体积比主流 Q4 小 20–30…
2026.08.29 · 周六约 2 分钟阅读
Reddit 用户 u/Dutchnamn 在 r/LocalLLaMA 发布了一组面向 Qwen3-Next Flash 的主线兼容 imatrix 量化版本,目标是让模型在保持与当前流行的 Unsloth、AesSedai Q4 量化相近质量的同时,显著降低磁盘与显存占用。
量化版本与核心卖点
作者在 Hugging Face 仓库 agentionai/Qwen3.8-Flash-Next-AP-GGUF 中发布了主推量化版本,推荐从 Q4 系列开始尝试,Q3 与 Q5 级别将在后续放出。
- 体积更小:相比 Unsloth、AesSedai 的 Q4 量化,体积可缩减约 20–30GB,具体取决于对比文件。
- 质量持平:PPL(困惑度)与上述主流 Q4 量化处于同一水平,详情已写进模型卡。
- 分层配比:采用逐层定制(per-layer / tailored)的量化方案,而非统一降低 bpw,从而在更小的体积下保住质量。
AMD Strix Halo 专项构建
针对 AMD Strix Halo 平台,作者单独发布了一份 ROCm FP4 量化:agentionai/Qwen3.8-Flash-Next-ROCmFP4-FAST-imatrix-GGUF。
- 在该硬件上,ROCm FP4 版本相比 Q4_XS 在速度和质量上略有优势。
- 主要面向使用 AMD 集成显卡或 APUs 进行本地推理的用户。
社区测试邀请
由于不同硬件、不同量化设置下的表现差异较大,作者呼吁感兴趣的本地部署玩家参与对比测试,反馈以下数据以便汇总:
- 所使用的具体量化版本;
- 实际占用 RAM/VRAM;
- 推理速度 tok/s;
- 与 Unsloth IQ4_XS 或 Q4_K 的主观质量对比。
总体而言,这是一次来自社区的本地推理优化实践,并非 Qwen 官方迭代,对本地部署爱好者有一定参考价值,但尚待更多独立基准验证。
