桃子桃子快讯
返回首页
工具

Project Zero:纯 C 实现的 CPU BitNet 推理引擎

开发者发布纯 C99、无外部依赖的 CPU 推理引擎 Project Zero,在 Xeon 上较 bitnet.cpp…

2026.07.23 · 周四3 分钟阅读

一位独立开发者在 Reddit r/LocalLLaMA 发布名为 Project Zero 的纯 C99 LLM 推理引擎,单二进制文件、零外部依赖,在 Intel Xeon 上对 Microsoft BitNet b1.58-2B-4T 实现约 1.87 倍的吞吐提升,并可直接读取 Qwen Bonsai-27B 的 GGUF 权重文件。该项目已在 GitHub 开源,作者同时向社区征集更多 x86 平台的基准数据。

性能数据与硬件配置

作者目前仅在两台机器上完成 BitNet 测试,结果如下:

  • Intel Xeon(Emerald Rapids,4 核):Project Zero 达 36.25 tok/s,bitnet.cpp 为 19.33 tok/s,加速比 1.87×,已逼近约 95% 的理论 DRAM 带宽上限。
  • i5-11300H(Tiger Lake,双通道 DDR4):约 16.1 tok/s 对比约 13.0 tok/s,加速比 1.23×

关键技术路线

BitNet 权重以三值 {-1, 0, +1} 按 4 字节打包。Project Zero 没有沿用「解压 → float → FMA」的常规路径,而是采用 3 条指令的 VBMI 内核:vpermi2b + vpternlogd + vpaddb,结果直接喂给 INT8 VNNI 累加指令 vpdpbusds。线程池基于 C11 原子量构建自旋-休眠机制,以减少 futex 系统调用开销。

模型与部署形态

  • BitNet b1.58-2B-4T:1.18 GB 二进制权重,支持完整 REPL 与 agentic 循环。
  • Qwen Bonsai-27B:通过 mmap 直接读取 Ternary-Bonsai-27B-Q2_0.gguf,在受限内存环境下也不会 OOM。

社区基准征集

由于当前 BitNet 仅有 2 组数据,作者希望拿到 AVX2 老款 CPU 以及高核数 Xeon/EPYC 上的 token 速率,以验证回退内核是否在旧架构上仍保持加速比。同时,PrismML 的 Bonsai 排行榜目前全部为 GPU 提交,作者希望补充 x86 CPU-only 条目。

测试与反馈渠道

需要注意的是,1.87× 的加速比来自开发者本人在单一硬件上的自测结果,覆盖机型有限,结论的普适性仍有待更多独立验证。

信源