社区团队推出 Qwen 3.8 27B 视觉模型 MLX 量化版并横向对比
AtomicChat 团队发布 9 档 Qwen 3.8 27B 视觉模型 MLX 量化版本,并在统一测试环境下对比多家…
AtomicChat 团队近日在 Reddit r/LocalLLaMA 发布了一组针对 Qwen 3.8 27B 视觉模型的 MLX 量化版本,并在统一测试框架下与多家社区量化方案进行横向对比。此次共放出 9 个构建,位宽从 8-bit(29.5 GB)一路压缩到 3.23 bpw DWQ(11.8 GB),覆盖从高显存到低显存的不同使用场景。
量化方法
团队基于自研的 MLX 剪枝搜索得到量化布局,并尝试把蒸馏思路引入低位量化:以 BF16 原模型作为教师,对低位模型进行 DWQ(Distillation-based Weight Quantization)训练。团队表示,目前每个量化版本仍残留少量精度空间,后续会继续优化并更新结果。
测试设置
对比测试在统一环境中完成,关键参数如下:
- 硬件:1 张 H200 NVL
- 推理框架:mlx-vlm,上下文长度 4096
- 评估数据:团队自有、未参与校准的 held-out 文本
- 评价指标:top-1 一致性,噪声地板 0.084%
所有对比文件均使用同一评测脚本与同一参考回答,避免不同 harness 之间的偏差。
关键对比结果
在相同测试条件下,团队发布的 11.8 GB 版本 top-1 达到 70.32%,而另外两个体积相近(均低于 12 GB)的社区量化版本分别为 53% 与 43%,差距明显。需要指出的是,top-1 一致性并非行业标准基准,参考价值有限。
在硬件适配方面,11.8 GB 版本可在 16 GB 内存的 MacBook 上运行,但需通过 sudo sysctl iogpu.wired_limit_mb=13000 提高 GPU 可用的 wired 内存上限(实际可用约 13–14 GB),相应上下文长度会受限。其余构建面向 24 GB 及以上显存的设备。
资源与背景说明
完整的量化版本集合已发布在 Hugging Face 的 AtomicChat 名下,包含更详细的量化方法说明与扩展基准测试链接。团队同时运营一款本地 AI 开源应用 atomic.chat,原帖署名成员并邀请读者反馈。需要注意的是,该项目来自社区贡献者,并非 Qwen 模型官方的正式发布,量化质量与命名口径均不在官方背书范围内。
