开源
斯坦福 Marin 535B-A23B 启动训练,全程开源
Percy Liang 团队宣布 535B 激活 23B 的 MoE 模型 Marin 本周开训,11 套 GB200…
2026.08.22 · 周六约 2 分钟阅读
斯坦福大学教授 Percy Liang 近日在 X 平台宣布,由其团队主导的大语言模型 Marin 535B-A23B 已于本周正式启动训练。与此前 Marin 项目一致,整个训练过程将完全公开。按照计划,这将是该团队迄今为止规模最大的一次模型训练,预计将持续约三个月,团队也坦言「肯定会遇到意想不到的问题」。
模型规模与硬件配置
Marin 535B-A23B 采用混合专家(MoE)架构,总参数量达 535B,每次推理激活约 23B 参数。本次训练的关键配置如下:
- 训练目标分布:预训练(pretraining)占 80%,中训练(midtraining)占 20%
- 数据总量:18.75 万亿 tokens
- 硬件平台:11 套 NVIDIA GB200 NVL72 集群
- 预计训练时长:约 3 个月
- 总算力消耗:约 2.7 × 10²⁴ FLOPs
预训练与中训练阶段结束后,团队还会继续推进后训练(post-training)流程,最终对外发布完整模型。
训练前的 scaling ladder 验证
在正式启动主训练之前,团队先行训练了一个四级(4-rung)scaling ladder,用以排查工程问题,并对主模型表现做出预测:
- 起点档:1.6B-A61M,训练 48B tokens
- 终点档:27.7B-A1.2B,训练 926B tokens
- 四个档位共同构成主模型的预测依据,帮助团队在真正投入 18.75T tokens 之前评估 scaling 行为
这种「先小后大」的做法是近年来大规模语言模型训练中的常见工程范式,可在大幅降低成本的前提下提前暴露稳定性、数据配比等方面的问题。
全程开源意味着什么
Marin 项目延续了 Percy Liang 团队一贯的高度开放姿态,训练数据配比、训练日志、中间 checkpoint 与最终权重都将向社区公开。这一选择带来几方面影响:
- 研究者可以实时跟踪训练进度、loss 曲线与下游评测表现
- scaling ladder 的实验数据可供学界复现并拓展至其他模型架构
- 最终模型将成为开源社区又一款重要的基座模型
后续的训练里程碑、中间评测结果与模型权重发布,预计都将在 Marin 项目的官方渠道持续更新。
