开源
社区新量化 Qwen3.5-9B 称 SOTA,多档位超越主流 GGUF
Reddit 用户 AaryanK 发布 Qwen3.5-9B 新 GGUF 量化版本,自测在 34 次同尺寸对比中取得…
2026.08.14 · 周五约 3 分钟阅读
Reddit 社区 r/LocalLLaMA 用户 AaryanK 近日上线了一套自研量化的 Qwen3.5-9B GGUF 模型,自述在 34 次「同尺寸」对照中拿到 31 胜、3 场统计性平局、0 负的战绩,并称其 Q4_K_XL、IQ2_M 等档位在多项指标上超过 Unsloth UD、bartowski、lmstudio-community、mradermacher、byteshape、AtomicChat 等已发布版本。模型权重与说明卡已挂载在 Hugging Face 个人页面(AaryanK/Qwen3.5-9B-GGUF)。
核心对比数据
作者公开了若干关键对比数字:
- Q4_K_XL:自研版本相对 Unsloth UD-Q4_K_XL,在 KLD 指标上提升约 23%,文件体积更小,且优势在全部 6 个评估域与 32k 上下文下均成立。
- IQ2_M:在字节数相同的前提下,自研版本距 BF16 参考差距缩小 36%(即更接近无损),HumanEval+ 得分高约 10 分。
- 旗舰档位:在 MMLU、HumanEval+、MBPP+ 与 BFCL 工具调用(含多轮智能体场景)上,与 BF16 参考「统计上不可区分」。
- 平局来源:唯一打平的为 Q6/Q8 这类「近无损」档位,多家量化版本在此区间趋同。
方法论与基准设置
作者强调所有竞品文件均使用同一台机器、对同一份 BF16 参考权重重新打分,未直接搬运他人模型卡上的数字。说明卡中包含:
- 评估任务列表与评分流程
- 10 万次重采样的置信区间
- 留出(held-out)切片下的判定结果
- 各档位速度对照表
不过本次发布并未提供论文级同行评议,也未公开独立第三方复现数据,所有结论目前均为作者本人测得。
作者背景与后续计划
AaryanK 自述仍在读本科,依赖租借的 4090 显卡完成此次重量化,因此后续节奏受限于算力预算。他在文中提到,验证完 Qwen3.5-9B 后,下一个目标是「即将发布」的 27B 级别模型,并暗示将沿用同一管线处理新版本权重。
本次实验目的,是测试其量化管线是否具备「可复用的 SOTA 能力」,新模型发布后将获得同等处理待遇。
作者同时在帖子末尾附上了个人 LinkedIn,表示正在寻找 AI 智能体编排与模型推理方向的实习机会。
信息边界提示
- 「Qwen3.5-9B」并非目前主流公开模型命名体系中的官方型号,文中数字均按原作者表述转写。
- 全部性能对比来自作者本人单卡评测,未经第三方独立验证。
- 该量化属于社区贡献性质,并非通义千问官方团队发布,读者在使用前建议自行复核关键基准。
