桃子桃子快讯
返回首页
开源

社区自量化 Kimi K3:Q3_K_S 版 1.1 TB 可在纯 CPU 推理

Atomic Chat 团队公开 Kimi K3 GGUF 量化进展,Q3_K_S 版约 1.1 TB,纯 CPU 环境…

2026.07.30 · 周四2 分钟阅读

社区团队 Atomic Chat 近日在 r/LocalLLaMA 公开了对 Kimi K3(2.8T 总参数、50B 激活 MoE 架构)模型的 GGUF 自量化结果。Q3_K_S 版本已完成并可正常加载,文件体积约 1114.76 GiB;Q1、Q2 更低比特量化仍在进行中,团队表示结果将于次日公布。

量化方法与工具链

  • 量化基于官方原始权重,使用团队自维护的 llama.cpp 分支进行动态量化
  • 已交付 Q3_K_S,Q1、Q2 进行中
  • 量化策略属于社区常用的 GGUF K-quants 方案,强调体积与质量的折中

硬件配置与推理性能

团队租用的运行节点规格如下:

  • CPU:AMD EPYC 9554P,64 核
  • 内存:1.5 TB DDR5
  • 存储:NVMe RAID0,用于放置权重文件
  • 推理完全在内存中完成,未使用 GPU

实测使用 110 线程运行,pp512(prompt processing 512 tokens)速度为 4.21 t/s。

能力验证

为确认量化未显著损伤模型能力,团队做了一次简短的图文理解测试:输入 1969 年《纽约时报》「Men Walk on Moon」头版图片,要求模型描述画面内容。模型准确识别出:

  • 报头信息
  • 「All the news that's fit to print」标语
  • 日期与 10 美分定价
  • 主标题与关于宇航员采集岩石样本的副标题
  • 「Voice from Moon」专栏

团队称未观察到明显的幻觉文本。

讨论与局限

团队在文末抛出一个开放问题:在消费级硬件上运行 1.1 TB 级别的超大规模量化模型,与选择体量更小、推理速度正常的模型相比,前者的实际收益如何。这一问题对本地部署与社区选型具有一定参考价值。需要指出的是,Q3_K_S 已属偏激进的低比特方案,进一步压缩到 Q1、Q2 后能力是否仍可保持,还有待后续数据验证。此外,原帖明确披露发布者为 Atomic Chat(atomic.chat)团队,内容具有产品与品牌曝光属性,读者评估时应一并考虑。

信源