桃子桃子快讯
返回首页
模型发布

Liquid AI 发布 LFM2.5-Encoder:长上下文编码器在 CPU 上提速约 3.7 倍

Liquid AI 在 Hugging Face 推出 230M 与 350M 两款编码器,支持 8K 上下文,CPU…

2026.07.28 · 周二4 分钟阅读

Liquid AI 近日在 Hugging Face 上线两款通用编码器 LFM2.5-Encoder-230M 与 LFM2.5-Encoder-350M,主打「体积小、上下文长、CPU 上跑得快」。两款模型均支持 8,192 token 上下文,在 GLUE、SuperGLUE 及多语言分类任务上,可与体积明显更大的编码器持平甚至超越,并填补了现代 BERT 类模型在高吞吐量、长输入场景下的速度短板。

为何要做通用编码器

Liquid AI 上个月刚发布了面向多语言检索的 LFM2.5-Retriever,本次编码器源自同一家族但定位更广:采用掩码语言建模(MLM)预训练,可微调用于分类、token 级任务与检索等多种用途。文章指出,意图路由、策略校验、PII 检测、文本分类等线上 NLP 工作负载通常全天运行、依赖 CPU、且输入越来越长,ModernBERT 之后需要「成本随输入缓慢增长」的下一代编码器,LFM2.5-Encoder 即为此而生。

架构改造要点

两款编码器分别从 LFM2.5-230M 与 LFM2.5-350M 解码器骨干初始化,再通过以下三处改动转成双向编码器:

  • 双向注意力掩码:每个 token 可同时看到左右两侧上下文;
  • 非因果短卷积:对称 padding,使卷积混合左右邻居信息;
  • 掩码语言建模:训练时随机遮蔽 30% token。

训练分两阶段:先用 1,024 token 上下文在大规模网页语料上做短上下文 MLM,再用全量数据把上下文扩展到 8,192 token,并强化事实性、法律与多语言能力。

基准与推理速度

在 GLUE、SuperGLUE 和多语言分类共 17 个任务、14 个模型的横向比较中,LFM2.5-Encoder-350M 排名第四,前面三个均为更大模型,其中包含一个约 10 倍体积的 3.5B 模型;LFM2.5-Encoder-230M 则在更小体积下击败 ModernBERT-base 与全部 EuroBERT 模型。作者报告了 5 个 held-out seed 的均值,并开源了完整评测框架与原始分数。

速度方面,CPU 上的差距最显著:

  • 在任意序列长度下,LFM2.5-Encoder-230M 都是 CPU 上最快的编码器;
  • 输入越长,ModernBERT-base 吞吐下降越陡,而 LFM2.5-Encoder 先冲入中段再趋平;
  • 在 8,192 token 时,ModernBERT-base 单次前向传播需约 1 分 30 秒,而 LFM2.5-Encoder-230M 仅需约 28 秒,约 3.7 倍加速。

官方表示,这意味着开发者可在笔记本 CPU 上于 30 秒内扫完或分类一整份合同、转写稿或长客服记录。GPU 上同样保持类似趋势但差距更小:约 2K token 之后 LFM2.5-Encoder 接管领先。

配套 demo 与使用建议

官方基于微调后的 LFM2.5-Encoder 构建了若干 CPU-only Hugging Face Space demo:

  • 零样本提示词路由:用自由文本定义路由通道,一次性打分整条 prompt;
  • 零样本策略校验:将公司规则写成自由文本,逐 token 打分;
  • 拼写检查:按 token 纠错;
  • PII 检测:覆盖 16 种语言、40 类个人信息识别与脱敏;
  • 掩码扩散文本生成(彩蛋):把编码器当作 chatbot,以反复「去掩码」代替自回归生成。

使用上,作者建议高体量、长驻运行的理解任务(分类、路由、抽取、评分)优先选用微调后的编码器,因为相比生成式 LLM 更小、更快、单机 CPU 即可承担。350M 版本适合追求精度上限的场景,230M 版本则面向更紧的硬件预算或更高吞吐需求。开发者可直接通过最新版 transformers 加载模型做掩码预测,或加挂自定义 head 完成下游任务微调。

信源