桃子桃子快讯
返回首页
开源

斯坦福 Marin 535B-A23B 启动训练,全程开源

Percy Liang 团队宣布 535B 激活 23B 的 MoE 模型 Marin 本周开训,11 套 GB200…

2026.08.22 · 周六2 分钟阅读

斯坦福大学教授 Percy Liang 近日在 X 平台宣布,由其团队主导的大语言模型 Marin 535B-A23B 已于本周正式启动训练。与此前 Marin 项目一致,整个训练过程将完全公开。按照计划,这将是该团队迄今为止规模最大的一次模型训练,预计将持续约三个月,团队也坦言「肯定会遇到意想不到的问题」。

模型规模与硬件配置

Marin 535B-A23B 采用混合专家(MoE)架构,总参数量达 535B,每次推理激活约 23B 参数。本次训练的关键配置如下:

  • 训练目标分布:预训练(pretraining)占 80%,中训练(midtraining)占 20%
  • 数据总量:18.75 万亿 tokens
  • 硬件平台:11 套 NVIDIA GB200 NVL72 集群
  • 预计训练时长:约 3 个月
  • 总算力消耗:约 2.7 × 10²⁴ FLOPs

预训练与中训练阶段结束后,团队还会继续推进后训练(post-training)流程,最终对外发布完整模型。

训练前的 scaling ladder 验证

在正式启动主训练之前,团队先行训练了一个四级(4-rung)scaling ladder,用以排查工程问题,并对主模型表现做出预测:

  • 起点档:1.6B-A61M,训练 48B tokens
  • 终点档:27.7B-A1.2B,训练 926B tokens
  • 四个档位共同构成主模型的预测依据,帮助团队在真正投入 18.75T tokens 之前评估 scaling 行为

这种「先小后大」的做法是近年来大规模语言模型训练中的常见工程范式,可在大幅降低成本的前提下提前暴露稳定性、数据配比等方面的问题。

全程开源意味着什么

Marin 项目延续了 Percy Liang 团队一贯的高度开放姿态,训练数据配比、训练日志、中间 checkpoint 与最终权重都将向社区公开。这一选择带来几方面影响:

  • 研究者可以实时跟踪训练进度、loss 曲线与下游评测表现
  • scaling ladder 的实验数据可供学界复现并拓展至其他模型架构
  • 最终模型将成为开源社区又一款重要的基座模型

后续的训练里程碑、中间评测结果与模型权重发布,预计都将在 Marin 项目的官方渠道持续更新。

信源