Qwen 3.5 4B 量化实验:张量级精度分配带来 16.67% 推理提升
社区开发者将张量级精度分配方法从 Gemma 扩展到 Qwen 3.5 4B,在 IQ2_XS 量化下推理得分相对提升…
一名社区开发者近期在 Hugging Face 上发布了一个基于 Qwen 3.5 4B 的实验性量化模型「Qwen3.5-4B-CADA-IQ2_XS」,其核心结论是:在 IQ2_XS 极低比特量化条件下,通过张量级精度分配(tensor-level allocation)替代默认的 imatrix 分配策略,模型在保留集推理任务上的得分从 46.875 提升到 54.688,相对增益达 16.67%,而文件体积仅增加约 0.412%。
实验背景
该实验的作者此前已在 Gemma 系列(包括 Gemma 3 4B 与 Gemma 4 12B 等)上验证过类似方法。本次工作的目标是将该机制迁移到 Qwen 模型家族,是「QLAB」框架首次在 Gemma 之外的密集模型上成功复现。作者明确表示,这一结果并不构成对 Qwen 模型本身的改进,而是一次量化分配机制的可迁移性验证。
方法概述
整个流程分为三步:
- 基于分类语料构建 importance matrix(imatrix);
- 量化后测量各类能力受损情况;
- 在固定字节预算内,将精度从低敏感张量重新分配到高敏感张量。
作者强调,本次实验没有引入任何后训练、LoRA、剪枝或权重更新,所有提升完全来自「精度花在哪里」这一维度的重新安排。
关键数据
在相同的 imatrix 与字节预算下,作者给出的核心对比数据如下:
- BF16 推理基线:78.125
- 原版 IQ2_XS + imatrix:46.875
- QLAB 张量级分配 + 同 imatrix:54.688
模型文件体积:
- 原版:1,630,594,336 字节
- QLAB 版:1,637,318,816 字节
- 差异:+0.412%
在作者评估的 11 个能力套件中,有 8 个相对原版量化有所改善,出现回退的领域主要集中在知识问答、结构化输出与文本连贯性。
局限与意义
作者同时指出,这是一项「分类定向」的量化实验,并不意味着模型整体能力提升;其价值在于证明张量级精度分配机制可以跨模型家族迁移,适用于密集模型、MoE、QAT 与非 QAT 多种训练路径。但实验仅覆盖 4B 规模,尚未在更大模型上验证。
后续计划
作者表示接下来将尝试 Qwen 1.5 A2 7B,并对更大的 Qwen 3.8 27B 发起实验。按照其估算,单次 27B 模型运行在 DigitalOcean 租赁 GPU 上的成本约 140 美元,且可能需要多次尝试才能确定最优精度分配方案,因此也在寻求社区算力支持。最终目标是构建一个完整流水线:接受全精度 GGUF → 用户选定关注能力 → 自动定位能力断崖 → 在字节预算内应用张量级分配以尽量保留目标能力。
