斯坦福 Marin 535B 大模型全程公开训练
斯坦福 CRFM 主导的 Marin 项目正在 11 套 GB200 NVL72 上公开训练 535B 总参数的 MoE…
斯坦福大学基础模型研究中心(CRFM)主导的开放基础模型项目 Marin,近日正式启动 535B-A23B 大模型训练。与常规「训练完成后再公布权重与报告」的做法不同,Marin 选择在训练尚未完成、甚至仍可能中途失败的情况下,把训练曲线、数据配方、模型配置和技术讨论全部放到网上。这一模式获得了吴恩达等人的公开力挺,其在 X 上的相关贴文浏览量已突破 80 万。
项目背景与核心目标
Marin 最早由斯坦福 CRFM 于 2025 年 5 月正式对外公布,发起公告的作者包括 David Hall、Percy Liang,以及来自斯坦福、Open Athena 和开放社区的多位研究人员。Percy Liang 同时也是开源 AI 公司 Together AI 的联合创始人之一,他长期关注基础模型的可复现性问题。
Marin 提出的核心问题是:在算力高度集中、训练配方越来越封闭的情况下,基础模型还能不能像开源软件一样被公开研究和共同建设?项目继承了 BLOOM、Pythia、OLMo、LLM360 等先行项目的开放经验,试图把开放从「一次模型发布行为」升级为实验室的默认工作方式。
训练规模与硬件配置
按照目前公布的计划:
- 模型类型:5350 亿总参数、约 230 亿激活参数的 MoE 模型,采用共享专家与路由专家并存设计,每层 2 个共享专家 + 8 个路由专家。
- 数据规模:18.75 万亿 Token,其中 80% 用于预训练,20% 用于中期训练。
- 计算量:约 2.7×10²⁴ FLOPs,训练周期约 3 个月。
- 硬件平台:11 套 NVIDIA GB200 NVL72 系统。
- 训练栈:JAX + XLA + Levanter 框架,团队为 JAX/XLA GPU 环境自行实现了一套专家并行方案。
模型没有一开始追求超长上下文,而是退回 4K 上下文启动预训练,目的是在每个 batch 中容纳更多独立序列,缓解专家间的负载不均。
「开放实验室」机制
Marin 建立了一种类似 GitHub 式协作的机制:
- 每个实验提前通过 GitHub Issue 声明目标与假设。
- 具体配置以代码和 Pull Request 提交,外部研究者可参与 Review。
- 实验启动后,Weights & Biases 上的训练指标公开。
- 所有成功、失败和中途修改均被记录,数据、代码、配方及最终模型继续开放。
吴恩达将 Marin 称为当前捍卫 AI 开放性的一次「珍贵示范」,强调该项目不仅开放模型代码,还公开数据、训练配方和实验全过程。
先搭建「缩放梯」再上大模型
Marin 没有直接把全部算力投入 535B 模型,而是先训练了一组规模递增的小型 MoE 模型,形成四级 Scaling Ladder(缩放梯),最高为 27.7B 总参数、约 1.2B 激活参数。这套缩放实验只占最终计算量的约 1%,但承担了若干关键任务:
- 预测 535B 模型在不同训练阶段应达到的损失水平。
- 提前暴露训练稳定性问题,例如梯度范数一度增长到 4 以上,由此引入 logit z-loss。
- 区分「正常波动」与「失控前兆」,帮助团队判断何时需要提前介入。
现阶段的关键观察点
Marin 535B 的训练仍然处于早期。该项目也明确承认,公开本身不能代替最终评测,也不能保证训练不会因系统或数据问题调整路线。从已有记录来看,至少有三个值得持续关注的技术问题:
- 专家路由在大规模训练中是否稳定,Token Dropping 比例能否控制在 3% 以内。
- 自研的 JAX/XLA 专家并行实现在 100 天连续训练中的可靠性。
- 当上下文长度从 4K 扩展到 65K,丢弃比例会如何变化。
这场实验现阶段最重要的产出,可能还不是三个月后的模型权重,而是它沿途留下的训练记录。即便其他团队无法复现整个 535B 模型,专家路由策略、Token Dropping 控制、梯度异常处理与 JAX/GB200 上的并行通信经验,都可被其他规模模型的研究者复用。
