桃子桃子快讯
返回首页
开源

Liquid AI 发布 LFM2.5 Q4_0 量化感知蒸馏检查点

Liquid AI 在 Hugging Face 发布 LFM2.5 四个尺寸的 QAD Q4_0 GGUF,可在保持…

2026.08.19 · 周三4 分钟阅读

Liquid AI 近日在 Hugging Face Blog 宣布,为 LFM2.5 系列模型新增一组采用「量化感知蒸馏」(Quantization-Aware Distillation,简称 QAD)训练的 Q4_0 GGUF 检查点,涵盖 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 四个规模。与常规训练后量化(PTQ)相比,QAD 让小参数模型也能在低比特下保留接近全精度的能力,对边缘端部署具有现实意义。

QAD 的核心思路

传统 PTQ 直接对权重做低比特压缩,会带来明显的精度损失;QAD 则把高精度教师模型的能力蒸馏进量化后的学生模型,让「训练阶段」就感知到量化误差。Liquid AI 介绍,QAD Q4_0 检查点保留了原生 Q4_0 GGUF 的内存占用与吞吐表现,同时:

  • 在 GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF、BFCLv4 等推理 / 指令跟随 / 工具调用 / Agent 类基准上,对应 BF16 基线的平均准确率恢复比例分别为 97.1%、96.5%、97.4%、96.6%;
  • 小模型额外加入 GSM8K 数学评测,大模型则使用 AIME25;
  • 所有结果取五次运行的均值。

也就是说,原本因 4-bit 量化损失掉的精度,约有 97% 被 QAD 「捡回来」。

边缘硬件上的速度与体积

Liquid AI 在四类真实边缘设备上测了解码吞吐:

  • MacBook Pro、NucBox EVO-X2:GPU 推理;
  • Samsung Galaxy S26 Ultra、Raspberry Pi 5:Arm CPU 推理。

主要结论:

  • 230M 与 350M 的 QAD Q4_0 检查点,在评估波动范围内匹配 Q5_K_M 的质量,解码吞吐还高出 4%–33%;
  • 1.2B 与 2.6B 的 QAD Q4_0 检查点匹配 Q4_K_M 质量,吞吐高出 3%–14%;
  • 在可对比的 230M 与 1.2B 上,QAD 检查点也能对标社区知名的 Unsloth UD-Q4_K_XL 后训练量化方案。

对希望在手机、迷你主机或树莓派上跑本地小模型的开发者来说,这意味着可以在不增加体积的前提下获得接近更高比特的质量。

上手使用

QAD Q4_0 GGUF 可直接与 llama.cpp 或任何支持 GGUF Q4_0 工件的推理运行时配合使用。例如在命令行下:

  • llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf -p "What is C. elegans?"

四个模型权重均已上线 Hugging Face,模型库分别为 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 与 LFM2.5-2.6B。需要引用时,Liquid AI 给出的文献条目为:Liquid AI,「LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment」,Liquid AI Blog,2026 年 8 月。

信源