桃子桃子快讯
返回首页
开源

1-bit 与 Ternary 低比特模型生态进展汇总

Reddit r/LocalLLaMA 社区汇总 Bonsai、Maple-Preview、Mach-1-Additiv…

2026.08.19 · 周三5 分钟阅读

r/LocalLLaMA 社区近日发布了一期针对 1-bit、2-bit、Ternary(三值)以及 BitNet 系列模型的月度跟踪帖,汇总了近期 Bonsai、Maple-Preview、Mach-1-Additive、Neutrino 等低比特量化模型的发布动态,以及 llama.cpp 等推理框架在后端兼容和性能优化方面的进展,主要服务于「无独显俱乐部」——即依赖 CPU 或苹果 Silicon 运行大模型的用户群体。

Bonsai / Ternary Bonsai 持续推进后端适配

Bonsai 系列来自 PrismML-Eng,是社区最早成体系的 1-bit 与 1.58-bit(Ternary)模型之一,今年 4 月发布首批版本,上月又放出 27B 参数版本。其中 1-bit 的 Bonsai-27B 已在主流推理后端跑通,但 Ternary 版此前仍有后端缺口。本月情况有明显改善:

  • 针对 CUDA 与 Vulkan 的 PR 已在主分支合并;
  • 另有 CUDA 优化 PR 合并,token 生成(tg)速度提升 15–40%,prompt 处理(pp)速度提升约 8%;
  • 官方 Demo 与定制 llama.cpp fork 均已在 GitHub 开源。

此外,社区还出现多个 Bonsai 27B 的衍生权重,包括 Abliterated(去对齐)、antidoom 等微调版本。

其他低比特模型动态

多支团队在同一时间窗内推出了新的低比特权重,覆盖文本、翻译、多模态和医学等不同方向:

  • BitCPM-CANN:OpenBMB 推出的低比特模型集合,托管于 HuggingFace。
  • Tencent Hy-MT1.5:腾讯发布的混合元翻译模型 1.5 版本,已在 HuggingFace 上线集合页。
  • Maple-Preview(DeepGrove):20B 参数、激活约 1B(A1B)的预览模型,在 Mac Mini M4 上可达 200+ t/s,在 iPhone 上可达 120+ t/s,依赖定制 llama.cpp 与 MLX fork。社区也出现了对应的 Abliterated 量化版。
  • Mach-1-Additive-35B:Syzygy Research 发布的 A3B 架构模型,消费级笔记本上最高 120 t/s,并提供多模态版本。团队在近期推文中透露,下一代模型将基于「Laguna-S-2.1」与「Qwen3.8-27B」构建。
  • Neutrino-8B:FermionResearch 发布的 8B 模型,配套定制 llama.cpp fork。
  • Pestle-27B-Ternary:Doses AI 推出的医学研究导向模型,使用自研 mortar.cpp 推理引擎,支持 CPU、CUDA 与 Metal。

图像领域同样出现了低比特尝试,包括 Bonsai 系列图像模型 4B 的 Ternary 与 Binary GGUF 量化版,以及 clark-labs 推出的 1.58-bit Sana 1.6B 图像模型。

llama.cpp 底层优化持续推进

低比特模型的实际可用性,很大程度上取决于 llama.cpp 等推理框架的底层支持。本期跟踪帖也汇总了几项关键 PR:

  • ggml-cpu:为 STQ1_0 三值量化补齐 ARM NEON vec_dot 内核(PR #22836);
  • ggml/cpu:在 TQ1_0 与 TQ2_0 的 vec_dot 内核中跳过零尺度块以提升效率(PR #23439);
  • ggml-cpu:为 x86 VNNI 兼容 CPU 添加 Q2_0 点积实现,速度提升约 3 倍(PR #26348)。

这些改动进一步缩小了低比特模型与主流量化方案之间的性能差距,使更多用户能够在无高端 GPU 的设备上本地运行大模型。

小结

整体来看,本期跟踪帖反映出 1-bit / Ternary 等极低比特量化方案正从实验性尝试走向更广泛的工程落地:模型侧百花齐放,推理框架侧持续补齐 ARM、x86 VNNI、CUDA、Vulkan 等后端支持。对希望在 CPU、苹果 Silicon 或入门级显卡上跑本地大模型的用户而言,这一生态值得长期关注。

信源