Featured image of post 535B大模型实时公开训练:斯坦福Marin项目开放训练过程

535B大模型实时公开训练:斯坦福Marin项目开放训练过程

Marin公开535B MoE训练过程与关键技术。

事件速览:535B大模型进入实时训练阶段

事件速览:535B大模型进入实时训练阶段
事件速览:535B大模型进入实时训练阶段|新闻截图

斯坦福大学基础模型研究中心(CRFM)相关的开放基础模型项目 Marin,已于上周启动 Marin 535B-A23B 模型训练。这个项目的看点不只是参数规模,而是把训练曲线、数据配方、模型配置和技术讨论尽可能放到公开环境中。

项目核心硬信息如下:

  • 项目背景:Marin 最早诞生于斯坦福 CRFM,并于 2025 年 5 月正式对外公布
  • 模型参数:总参数 5350 亿,激活参数约 230 亿(MoE 架构)
  • 训练规模:18.75 万亿 Token(预训练约 80%,中期训练约 20%)
  • 硬件配置:11 套 NVIDIA GB200 NVL72 系统
  • 预计周期:约 3 个月,总计算量约 2.7×10²⁴ FLOPs
  • 当前状态:训练仍在进行中,后续还将进入后训练阶段

关键反差点:尽管项目名为 535B,但因采用 MoE(混合专家模型)设计,单个 Token 实际激活约 230 亿参数。Marin 在正式扩大到 535B-A23B 之前,还先进行了多级小模型缩放实验,用较低成本验证训练配方、损失曲线和稳定性风险。

开放实验室:从结果公开到过程透明

开放实验室:从结果公开到过程透明
开放实验室:从结果公开到过程透明|新闻截图

Marin 项目由斯坦福计算机科学副教授、CRFM 主任 Percy Liang 等人推动,发起公告作者包括 David Hall、Percy Liang,以及来自斯坦福、Open Athena 和开放社区的多位研究人员。项目试图回答一个核心问题:在算力高度集中、训练配方越来越封闭的情况下,基础模型能否像开源软件一样被公开研究和共同建设?

Marin 的“开放实验室”机制包括:每个实验通过 GitHub Issue 提前声明目标和假设,具体配置以代码和 Pull Request 提交,外部研究者可以参与 Review;实验启动后,W&B 训练指标公开。更重要的是,成功、失败和中途修改痕迹都会被记录,数据、代码、配方及最终模型也会继续开放。

这并不意味着 Marin 是第一个公开大模型训练过程的项目。此前 BLOOM、Pythia、LLM360、OLMo 等项目已经在不同程度上开放了训练数据、代码、日志或中间检查点。Marin 的特别之处在于,它试图把开放从一次模型发布行为,扩展为实验室默认工作流:从提出假设、提交代码到训练过程中的问题,都尽量实时公开。

Percy Liang 曾任对话式 AI 公司 Semantic Machines 首席科学家,该公司于 2018 年被微软收购;他也是 Together AI 的联合创始人之一。吴恩达转发相关消息时,将 Marin 称为当前捍卫 AI 开放性的一次“珍贵示范”,并强调该项目不仅开放模型代码,还公开数据、训练配方和实验过程。

技术攻坚:专家并行与 Token 丢弃的平衡术

Marin 535B-A23B 采用 MoE 架构。公开技术说明显示,这款模型每层保留 2 个共享专家,同时激活 8 个路由专家;两类专家均采用半宽结构,路由专家还使用 2 倍压缩。团队将其等效描述为:共享专家提供约一个隐藏层宽度的神经元,路由专家提供约两个隐藏层宽度的神经元。

换句话说,大约三分之一的专家计算来自始终工作的共享专家。这个设计不是为了让参数数字更好看,而是为了降低 MoE 训练中 Token Dropping(Token 丢弃)带来的风险。

Expert Parallelism(专家并行)是训练瓶颈之一。当 Token 被路由到分布在不同 GPU 上的专家时,系统需要进行 All-to-All 通信:先把 Token 发送给对应专家,专家完成计算后再把结果送回原路径。MoE 的稀疏计算节省了单个 Token 的计算成本,但也带来了跨卡通信、专家负载不均和内存访问等工程挑战。

Marin 团队披露,之前的实验中,当上下文长度从 4K 扩展到 65K 时,Token Dropping 比例曾从约 7% 上升至约 40%。原因之一是:在总 Token 批量相对固定时,上下文越长,一个批次中包含的独立序列越少,Token 分布更容易不均衡。

因此,Marin 535B 没有一开始就追求超长上下文,而是退回 4K 上下文启动预训练。与 8K 相比,同样规模的 Token 批次可以容纳约两倍的独立序列,有助于让不同专家获得更均匀的输入。团队测试的新型 pooled/wave 专家并行方案,在 4K 上下文下将 Token Dropping 降至约 3%。不过 Marin 也明确承认,这套实现仍具有实验性质,延长到 65K 后丢弃比例可能再次变得过高。

JAX训练栈与GB200集群挑战

JAX训练栈与GB200集群挑战
JAX训练栈与GB200集群挑战|新闻截图

Marin 的训练栈主要建立在 JAX、XLA 和 Levanter 之上。此前,Marin 8B 和 32B 主要运行在 Google TPU 上;此次 535B 模型转向 NVIDIA GB200 NVL72,意味着团队需要重新处理 GPU 集群上的专家并行和通信效率问题。

Marin 在公开记录中表示,由于没有找到在 JAX/XLA GPU 环境中性能足够好的现成专家并行方案,团队自行实现了 EP,也就是 Expert Parallelism。GB200 NVL72 将 72 颗 Blackwell GPU 和 36 颗 Grace CPU 组织在一个机架级 NVLink 域中,适合运行需要大量跨卡通信的 MoE 模型,但硬件本身并不能保证训练必然成功。

从公开材料看,Marin 还预留了针对硬件故障、模型计算利用率下降和进度延误的应对方案。如果问题出现在前 25% 的 Token 预算内,团队可能缩短最终 Token 训练量,并重新调整线性学习率衰减和数据配比,而不是机械维持原计划。

缩放梯策略与故障预判系统

缩放梯策略与故障预判系统
缩放梯策略与故障预判系统|新闻截图

在正式训练 535B 前,项目先构建了一套四级“缩放梯”(Scaling Ladder),用较小模型检查训练配方能否随规模稳定扩展,并拟合损失、计算量和模型规模之间的关系。

按照公开信息,这些模型覆盖:

模型总参数激活参数作用
最小模型1.6B61M低成本验证训练配方
中间模型逐级扩大逐级扩大检查缩放趋势
最大预实验27.7B约 1.2B外推 535B 训练表现

Marin 表示,这套缩放实验整体只占最终计算量的约 1%,但能承担几项关键任务:

  1. Loss 曲线预判:预测 535B 在不同训练阶段应达到的损失水平,若主训练曲线明显偏离,可较早发现数据、路由或优化器问题
  2. 稳定性检测:此前缩放实验发现,随着 Token 训练周期拉长,梯度范数一度增长到 4 以上;后续消融显示,在高 Batch Size 等条件下,如果不处理,训练可能中途发散
  3. 波动区分:一些小模型的梯度范数会在前 40% 训练阶段持续上升,随后随着学习率下降而回落;这有助于区分正常波动和失控前兆

团队最终加入了 logit z-loss。它通过惩罚过大的 logit 归一化项,限制模型输出分布的数值幅度,从而降低 Softmax 和路由训练过程中的数值不稳定风险。

实用建议与行业启示

适合立即跟进者:中等规模研究团队不一定能复现完整 535B 训练,但可以关注 Marin 公开的专家并行实现、Token Dropping 监控、缩放梯设计和故障处理记录。这些经验可迁移到更小规模的 MoE 训练中。

建议再等等者:如果关心最终模型能力、横向 benchmark 或实际应用效果,仍应等待训练完成及后训练阶段结束。当前训练损失主要反映模型对数据分布的拟合程度,代码、数学、工具调用、长上下文和 Agent 能力还会受到数据质量、中期训练及后训练方法影响。

写在最后:开放模型过去主要解决“谁可以使用模型”的问题,Marin 进一步追问的是“谁有权知道模型究竟如何被训练出来”。如果训练成功,社区将获得少见的大规模 MoE 训练样本;即便中途遇到问题,公开的故障路径同样具有研究价值。