开源
Qwen3.5-122B-A10B 原生 MLX 3-bit 量化版 WinterMix38 发布
社区开发者 WinterCharm 发布原生 MLX 3-bit 量化版本 WinterMix38,声称在长上下文场景下…
2026.08.10 · 周一约 4 分钟阅读
社区开发者 WinterCharm 在 r/LocalLLaMA 发布了一款名为 WinterMix38 的原生 MLX 3-bit 量化版本,目标模型为 Qwen3.5-122B-A10B,权重以 Apache 2.0 协议托管在 Hugging Face 上,体积约 59 GiB。该项目由作者在其单台 M5 Max MacBook Pro 上独立完成,历时 17 天,是 WinterMix 量化方法系列的最新一档。
发布背景与方法概述
WinterCharm 指出,MLX 格式在 Apple Silicon 上的推理速度显著高于 llama.cpp:M5 Max 上 prefill 阶段约快 9 倍,token 生成约快 20%。但现有的 6-bit 以下 MLX 量化普遍存在长链推理中舍入误差累积、上下文失效等问题。
WinterMix38 采用的是「Winter-Mix Quantization」方法,主要特点包括:
- 基于敏感度的混合精度分配,对路由关键张量设置硬约束;
- 类 GPTQ 的舍入方案,配合覆盖全专家的多样化长上下文校准数据;
- 新增「推理链退火」后处理阶段,利用模型自身 token 流统计信息对推理链路进行最终修正,这一阶段为本档新增,尚未回灌到此前发布的 wMix58、wMix48 等版本。
完整流程未公开,作者表示方法仍在迭代中。
基准测试结果
在不同上下文长度下的 perplexity 对比如下(数值越低越好):
- 2K:Unsloth UD-Q3_K_XL 4.3460 vs WinterMix38 4.3556(imatrix +0.22%)
- 16K:Unsloth 4.3264 vs WinterMix38 4.3329(imatrix +0.15%)
- 24K:Unsloth 4.7728 vs WinterMix38 4.6666(−2.2%)
- 48K:Unsloth 5.6064 vs WinterMix38 5.4232(−3.3%)
- 96K:Unsloth 5.5910 vs WinterMix38 5.2733(−5.7%)
关键发现:
- 16K 上下文之内 WinterMix38 与 Unsloth 的 Q3_K_XL GGUF 处于统计持平水平;
- 超过约 16–20K 后 WinterMix38 全面领先,且优势随上下文深度单调扩大;
- 16K 时已能击败同模型体量更大的 5-bit GGUF 旗舰版(−1.9%)以及 85.6 GiB 的 Q5_K_XL(−1.2%);
- 长上下文验证至 98K,未出现深度崩溃;
- 在保留出的 agentic 会话数据上取得 2.7385 的得分,优于同系列 WinterMix 旗舰(2.7627)、WinterMix48(2.7590)与 WinterMix68(2.7594);
- 8 种文字脚本的多语言评估中达到该档并列最佳。
后续计划
- WinterMix28(2-bit 版本):同模型的 2-bit 量化正在开发中,作者表示 3-bit 的经验可直接迁移到 2-bit 档位,将沿用同一套预注册预测、行为探针与全 trace 读取的发布门槛;
- 方法回灌:将「推理退火」技术回灌到此前发布的 wMix58 与 wMix48 量化版本上。
该项目面向本地部署与 Apple Silicon 用户,权重已开源,可在 LM Studio 等支持 MLX 的推理框架中直接加载使用。
