蚂蚁 Ling 3.0 开源两款 MoE 基座权重
AntLing 开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base 两款 MoE 基…
蚂蚁集团旗下 AI 团队 AntLing 近日在 Hugging Face 等平台开放了 Ling-3.0 系列两个基座模型的 6 个 checkpoint 权重,覆盖预训练、中训练以及 WSM 合并三个阶段,均未经过 post-training,为研究者和工程师保留了继续预训练、微调与下游研究的空间。这是 Ling 系列自 Ling-2.5 之后的又一次开源动作,首次系统性公开训练中间态与合并权重。
发布概览:6 个 Checkpoint 同步释放
此次开源并非单一权重文件,而是按照训练阶段拆分的多个 checkpoint,包括:
- 预训练阶段(pre-trained)checkpoint
- 中训练阶段(mid-trained)checkpoint
- WSM 合并后(WSM-merged)checkpoint
每一阶段都对应 tiny 与 flash 两个规格,合计 6 个权重文件,方便社区针对不同研究目的挑选合适的起点。
技术亮点:用 WSM 取代学习率衰减
本次发布在训练流程上做了一个有意思的替换:用 WSM(weighted checkpoint merging)替代传统意义上的学习率衰减。
- 学习率衰减被转化为对不同 checkpoint 的加权合并,天然契合持续预训练(continual pre-training)
- 在离线状态下即可探索不同的学习率调度策略,无需反复启动训练任务
- 社区可以用同一套训练配方先在 tiny-base 上验证,再放大到 flash-base,提高实验效率
Ling-3.0-tiny-base:7.9B 总参数 / 1.3B 激活
tiny-base 采用 MoE 架构,总参数 79 亿,每次推理激活约 13 亿参数。官方表示其总参数量约为 Ling-2.5-mini-base 的一半,但在大多数基准测试上取得相当甚至更优的表现,尤其在代码类任务上提升明显。官方建议将其用于:
- 代码方向的预训练与 SFT
- RL 后训练研究
- 教学用途
- 模型行为分析以及 MoE 机制研究
Ling-3.0-flash-base:124B 总参数 / 5.1B 激活
flash-base 同样为 MoE 架构,总参数 1240 亿,激活约 51 亿。在 coding、reasoning 以及长上下文任务上的评测中,即使对比参数量 2–3 倍于自身的模型,也能保持有竞争力的表现。官方给出的适用场景包括:
- 持续预训练(continued pre-training)
- Post-training 与领域适配
- 代码、长流程工作流
- 金融、医疗等垂直领域的下游任务
由于 flash-base 兼具较大的总参数容量与较低的激活开销,其定位介于「研究用大模型」与「可部署 MoE」之间,对资源受限但希望探索 100B+ 量级 MoE 行为的团队具有一定吸引力。整体来看,本次开源的重点并不只在模型本身,而是把训练策略本身(WSM 替换 LR decay)一并产品化交付,降低了社区复现和迭代的成本。
