开源
Liquid AI 发布 LFM2.5-8B-A1B:原地升级分词器技术
Liquid AI 开源 LFM2.5-8B-A1B,提出在不重新训练的情况下将模型词表由 65K 扩展至 128K 的…
2026.07.22 · 周三约 2 分钟阅读
Liquid AI 近日公布了 LFM2.5-8B-A1B 模型,并详细分享了其所采用的「原地扩展分词器(tokenizer expansion)」技术。这一方法允许在不从头训练的前提下,对已预训练模型的词汇表进行升级,以解决原分词器在部分语言上切分过细的问题。
核心技术:词表原地扩展
- 改造对象:基于已有预训练模型升级分词器,避免大规模重新训练开销
- 词表规模:将词汇表从 65K 扩展至 128K,约翻一倍
- 设计动机:弥补原分词器对部分语言过度切分导致的编码效率与生成质量问题
模型 LFM2.5-8B-A1B
- 名称中的「A1B」通常指模型采用 MoE 风格的激活参数结构(具体架构以官方报告为准)
- 模型已在 Hugging Face 开源权重,社区可直接下载测试
- 配套发布的技术报告详细记录了词表迁移、embedding 初始化以及与原模型的对比方法
研究与开源资源
- 博客原文:liquid.ai/blog/tokenizer-expansion
- 技术报告:arxiv.org/abs/2607.15232
- 模型仓库:huggingface.co/LiquidAI/LFM2.5-8B-A1B
对社区的意义
对需要在已有模型上扩展多语言能力、或希望在不损失原始训练成本的前提下修复分词问题的开发者而言,原地升级方案提供了一条成本更低的路径。相比传统的从头训练或大规模继续预训练,该方法在算力与时间上更具可操作性,也为后续词表迁移类研究提供了一个可复现的参考案例。
