桃子桃子快讯
返回首页
行业动态

Qwen3.8-Flash-Next 本地实测:M4 Max 上跑出 94% 基准分

Reddit 用户在 M4 Max 128GB 上测试 Qwen3.8-Flash-Next 量化版,其 cupel 基…

2026.08.27 · 周四2 分钟阅读

一名 Reddit 用户在 r/LocalLLaMA 板块分享了对一个名为「Qwen3.8-Flash-Next」的模型在 Apple M4 Max 128GB 机器上的本地推理测试结果。该帖提到模型采用了「qwen4_exp」架构,但目前 oMLX 与 llama.cpp 对该架构的支持尚不完整,作者不得不关闭 K/V 缓存并采用 4 bit 量化,整体占用约 100 GB 显存,运行已相当紧张。

cupel 基准首次突破 94%

作者运行了自己维护的「cupel」基准(涵盖编程、通用知识与科学三类任务),并表示这是今年首款在该基准上突破 94% 的模型。在具体对比中:

  • Qwen3.8 27B 总体表现优秀,但在编程项领先的同时,通用知识被 Gemma 31B 与 Qwen3.6 反超。
  • 4 bit 量化版本(4_8bit 混合量化)在编程和综合任务上仍保持了较强竞争力。

两套推理引擎的量化对比

作者分别用 oMLX 与 llama.cpp 跑了两组量化版本,并给出了 bfloat16 精度下的 build perplexity:

  • bfloat16:4.4708
  • MLX mixed-4_8bit(pipenetwork/Qwen3.8-Flash-Next-MLX-mixed-4_8bit):4.5286
  • Unsloth GGUF UD-IQ4_XS(unsloth/Qwen3.8-Flash-Next-GGUF):未单独公布 perplexity,位列其自制排行榜第 6 位

作者认为,MLX 的混合量化在质量上略优于 Unsloth 的 GGUF 量化,但受限于显存无法在 llama.cpp 路径下放入更大尺寸的量化包。

后续计划

作者表示正在整理过去数月的编程相关测试片段,未来会加入更多项目(如 hermes、pi、opencode 等)以增强 cupel 基准的区分度,原话是「模型越来越强,已经很难拉开差距了:我喜欢这种变化」。

注:原帖中模型名称「Qwen3.8-Flash-Next」及「qwen4_exp」架构表述为社区用户说法,并非来自阿里官方发布渠道,相关细节仍需进一步核实。

信源