8GB 显存实测 Bonsai 27B 三值模型:跑得动,但输给 Qwen3.5-9B
社区用户在 RTX 5070 笔记本上跑 Ternary-Bonsai-27B(2-bit)与 Bonsai-27B(1…
一位社区用户在 Reddit r/LocalLLaMA 板块分享了自己在消费级笔记本上跑 Bonsai 系列三值(ternary)量化模型的实测结果。Bonsai 是把 27B 参数的模型压缩到 2-bit 甚至 1-bit 的极端量化版本,主打「能塞进 8GB 显存」。本次测试使用的是 RTX 5070 笔记本版(8GB 显存)、i9-14900HX、32GB 内存与 CUDA 13.1,并通过 PrismML 维护的 llama.cpp fork 加载——官方原版 llama.cpp 暂不支持 2-bit kernel。
测试设置
- 基准:Terminal-Bench 2.0,全部 89 个任务
- 调用方式:little-coder harness,通过 harbor 适配器接入
- 参数:单次尝试(k=1),最多 40 轮,采样温度 0.2
- 对比对象:作者此前对 Qwen3.5-9B 与 Qwen3.6-35B-A3B 在同一 harness 上跑出的 k=5 结果
2-bit 版本:能跑,但不够准
Ternary-Bonsai-27B 在 Terminal-Bench 2.0 上得分 7.9%,而同样能完整跑在 8GB 显卡上的 Qwen3.5-9B 得 9.2%,更进一步的 Qwen3.6-35B-A3B(MoE 架构,激活参数 3B)拿到 24.3%。
也就是说:
- 7.9% 的成绩低于「正常 Q4 量化的 9B 密集模型」9.2%
- 在 Bonsai 2-bit 解出的 7 个任务里,35B-A3B 解出了其中 6 个
- 工具调用(tool calling)全程零解析错误,表现干净
作者的评价比较直接:在同一张 8GB 显卡上,与其跑一颗 27B 的极端量化模型换取「塞得下」,不如直接用一颗更小的密集模型做常规 Q4 量化,至少准确率更好。
1-bit 版本:在 agent 循环里不可用
Bonsai-27B 的 1-bit 版本表现更糟。在普通单轮问答里它还能给出正确结果(例如「12×12=144」、「is_prime(1007)」用 1007 token 干净停下),但放进 agentic loop 后就完全跑飞:
- 第一个任务就吐出一段 14000+ token 的回复,直到耗尽 32k 上下文都没有发出 stop token
- 失败模式是「自我验证」式的复读——即使面对很简单的 prompt,模型也会不断自检,随着任务难度上升这种倾向雪球式放大,最终无法终止
作者在确认问题后主动中止了整轮 1-bit 测试。结论是:1-bit 模型不适合作为 agent 后端,简单问答场景下尚可。
总体评价
这次实测说明,三值/二值量化的真正卖点是「让大模型塞进小显存」,而不是「在小显存上拿到更高准确率」。在 8GB 这个档位上,一颗 9B 级别的密集模型做 Q4 量化,仍然是更优解。Bonsai 这条技术路线本身值得关注,但其目前的实际收益还不足以替代传统的「小模型 + 常规量化」组合。
作者表示愿意进一步提供更多数据,欢迎感兴趣的读者在原帖互动。
