桃子桃子快讯
返回首页
开源

Qwen3.5-122B-A10B 原生 MLX 3-bit 量化版 WinterMix38 发布

社区开发者 WinterCharm 发布原生 MLX 3-bit 量化版本 WinterMix38,声称在长上下文场景下…

2026.08.10 · 周一4 分钟阅读

社区开发者 WinterCharm 在 r/LocalLLaMA 发布了一款名为 WinterMix38 的原生 MLX 3-bit 量化版本,目标模型为 Qwen3.5-122B-A10B,权重以 Apache 2.0 协议托管在 Hugging Face 上,体积约 59 GiB。该项目由作者在其单台 M5 Max MacBook Pro 上独立完成,历时 17 天,是 WinterMix 量化方法系列的最新一档。

发布背景与方法概述

WinterCharm 指出,MLX 格式在 Apple Silicon 上的推理速度显著高于 llama.cpp:M5 Max 上 prefill 阶段约快 9 倍,token 生成约快 20%。但现有的 6-bit 以下 MLX 量化普遍存在长链推理中舍入误差累积、上下文失效等问题。

WinterMix38 采用的是「Winter-Mix Quantization」方法,主要特点包括:

  • 基于敏感度的混合精度分配,对路由关键张量设置硬约束;
  • 类 GPTQ 的舍入方案,配合覆盖全专家的多样化长上下文校准数据;
  • 新增「推理链退火」后处理阶段,利用模型自身 token 流统计信息对推理链路进行最终修正,这一阶段为本档新增,尚未回灌到此前发布的 wMix58、wMix48 等版本。

完整流程未公开,作者表示方法仍在迭代中。

基准测试结果

在不同上下文长度下的 perplexity 对比如下(数值越低越好):

  • 2K:Unsloth UD-Q3_K_XL 4.3460 vs WinterMix38 4.3556(imatrix +0.22%)
  • 16K:Unsloth 4.3264 vs WinterMix38 4.3329(imatrix +0.15%)
  • 24K:Unsloth 4.7728 vs WinterMix38 4.6666(−2.2%)
  • 48K:Unsloth 5.6064 vs WinterMix38 5.4232(−3.3%)
  • 96K:Unsloth 5.5910 vs WinterMix38 5.2733(−5.7%)

关键发现:

  • 16K 上下文之内 WinterMix38 与 Unsloth 的 Q3_K_XL GGUF 处于统计持平水平;
  • 超过约 16–20K 后 WinterMix38 全面领先,且优势随上下文深度单调扩大;
  • 16K 时已能击败同模型体量更大的 5-bit GGUF 旗舰版(−1.9%)以及 85.6 GiB 的 Q5_K_XL(−1.2%);
  • 长上下文验证至 98K,未出现深度崩溃;
  • 在保留出的 agentic 会话数据上取得 2.7385 的得分,优于同系列 WinterMix 旗舰(2.7627)、WinterMix48(2.7590)与 WinterMix68(2.7594);
  • 8 种文字脚本的多语言评估中达到该档并列最佳。

后续计划

  • WinterMix28(2-bit 版本):同模型的 2-bit 量化正在开发中,作者表示 3-bit 的经验可直接迁移到 2-bit 档位,将沿用同一套预注册预测、行为探针与全 trace 读取的发布门槛;
  • 方法回灌:将「推理退火」技术回灌到此前发布的 wMix58 与 wMix48 量化版本上。

该项目面向本地部署与 Apple Silicon 用户,权重已开源,可在 LM Studio 等支持 MLX 的推理框架中直接加载使用。

信源