桃子桃子快讯
返回首页
开源

Unsloth 发布 Kimi K3 量化版本,最低 594GB 可本地运行

知名开源工具团队 Unsloth 将 Kimi K3 量化为 8/4/2/1 bit 四档,体积从 1.56TB 压缩至…

2026.07.30 · 周四2 分钟阅读

知名开源模型优化团队 Unsloth 在 Reddit 社区宣布,已完成对 Moonshot AI Kimi K3 大模型的量化压缩,并对外公开多档位版本。原模型在 8-bit 精度下体积高达 1.56 TB,对本地硬件门槛极高;经过 Unsloth 处理后,最低 1-bit 版本可压缩至 594 GB,使普通用户在多卡工作站或服务器级消费硬件上尝试运行该模型成为可能。

各档位量化规格

Unsloth 一次性放出四种精度版本,覆盖从「无损」到「极限压缩」的完整谱系:

  • Q8(8-bit):1.56 TB,官方标注为 lossless(无损);
  • Q4(4-bit):1.51 TB,体积下降有限,仍保留绝大多数精度;
  • Q2(2-bit):861 GB,体积接近「腰斩」,是平衡选项;
  • Q1(1-bit):594 GB,约为原模型三分之一,为最低门槛版本。

四档位采用线性递进的压缩策略,让用户能够根据显存、内存与精度需求进行取舍。

精度表现与可用性

Unsloth 在发布说明中重点强调,最小的 Q1 版本仍保留了 78.9% 的原始准确率。对于一款参数量极大的 MoE 大模型而言,1-bit 量化后仍能维持近八成能力,意味着 Kimi K3 在显著降低硬件门槛的同时,推理质量并未出现灾难性下降。Q2 与 Q4 版本在精度上的损失预计更小,更适合追求稳定输出的本地应用场景。模型运行所需的推理配置与依赖信息已附在模型卡(model card)中,用户可直接按指引部署。

对本地大模型社区的意义

Kimi K3 原生体积超过 1.5 TB,此前几乎只能在云端多机集群上运行。Unsloth 的量化工作将可运行硬件门槛拉低至「多张消费级 GPU + 大容量内存/SSD 卸载」即可尝试的区间,对希望本地复现国产前沿大模型能力的开发者与研究者具有实际意义。需要注意的是,本次发布为社区主导的第三方量化产物,并非 Moonshot AI 官方行为,相关精度数据与稳定性仍需在更多真实负载下进一步验证。

信源