桃子桃子快讯
返回首页
模型发布

腾讯混元公布超低比特量化结果,准确率几乎不降

腾讯混元官方账号披露一组约 2.38 bit 量化结果,多项主流基准准确率相比 BF16 仅下降 0.1–1.6 个百分…

2026.08.29 · 周六2 分钟阅读

腾讯混元(Tencent Hunyuan)近日在官方 X 账号发布了一组超低比特量化数据,显示其模型在仅约 2.38 bit 精度下,多项主流基准准确率几乎未受影响。该消息由 r/LocalLLaMA 论坛用户转帖讨论,引发开源本地部署社区关注。

量化精度与命名

原帖标题以「1-bit quant」为吸睛点,但作者在评论区澄清:实际权重精度约为 2.38 bit bpw(bits per weight),官方仅以「Q1」标签对外发布。这意味着每个参数平均仅占用 2.38 比特存储,远低于常见的 4-bit、6-bit 甚至 8-bit 量化方案。原帖作者本人也因内存不足暂未在本地实测。

基准测试结果

根据官方推文披露的 BF16 与该量化版本的对比数据,准确率跌幅非常有限:

  • MCP Atlas:83.7 → 83.2(下降 0.5)
  • SWE-Bench multi:82.9 → 81.3(下降 1.6)
  • MRCR:81.3 → 81.1(下降 0.2)
  • IFBench:73.5 → 72.5(下降 1.0)

四项基准的下滑幅度均不超过 1.6 个百分点,覆盖了推理、代码、长上下文与指令跟随等典型任务场景。

社区讨论焦点

转帖者评价「结果看起来非常乐观」,但同时对命名提出疑问:被冠以「Q1」的低位量化实际精度高于字面含义,标签存在一定营销色彩。讨论中也有人关心该量化对应的是哪一代 Hunyuan 模型、权重是否会同步开源,以及对显存占用与推理速度的实际收益。

待确认事项

目前官方推文仅给出基准数字,尚未说明:

  • 具体对应的 Hunyuan 模型版本
  • 量化权重是否公开发布,以及下载渠道
  • 显存节省、推理吞吐等部署层面数据
  • 是否需要特定推理框架(如 GPTQ、AWQ、bitsandbytes 等)支持

社区普遍期待官方后续释放权重与技术说明,以判断该方案在消费级硬件上本地部署大模型的真实可行性。

信源