围观 535B 模型训练炸炉:斯坦福教授开启大模型“全公开直播”,黑箱时代终于被撕开裂口
围观 535B 模型训练炸炉:斯坦福教授开启大模型“全公开直播”,黑箱时代终于被撕开裂口
在过去三年里,大模型行业形成了一种极其诡异的默契:
各家大厂疯狂发论文、刷榜单、开发布会,展示出来的永远是训练完成后的完美权重与光鲜跑分;但关于底层的数据配比、硬件故障、Loss 突刺(Spike)、超参数试错,以及中途经历了多少次“训练炸炉”,全部被锁死在商业机密的黑箱里。
但就在今天,斯坦福大学知名教授、Simile AI 创始人 Percy Liang 掀翻了这张桌子:
由 Marin 开放实验室发起的 Marin 535B-A23B(5350 亿总参数、230 亿激活参数的 MoE 大模型)正式启动预训练。整个为期 3 个月、消耗 18.75 万亿 Token、调用 792 颗英伟达 GB200 GPU 的完整训练过程,在 Weights & Biases(WandB)与 GitHub 上进行 24 小时全球无死角直播!
从实时 Loss 曲线、梯度范数突变,到数据混合比例与训练崩溃日志,所有人都可以坐在屏幕前,实时围观一个前沿巨型模型如何从零诞生。
这不仅是一场学术圈的极客行为艺术,更是大模型预训练从“玄学炼丹”迈向“透明工程科学”的真正分水岭。
撕开黑箱:我们在直播里到底在围观什么?
过去很多团队在复现百亿、千亿模型时,最痛苦的不是算力不够,而是缺乏真实训练过程中的“故障先验”。
在传统的黑箱模式下,大厂只告诉你“最终我们收敛到了这里”;但中途遇到的死锁、硬件掉卡、梯度爆炸和学习率调整,全靠开发者自己拿真金白银去试错。
Percy Liang 团队这次公开的不仅是训练监控面板,而是一整套严密的 Scaling Ladder(规模扩展阶梯) 体系:
1. 梯形预演验证 Scaling Law: 在启动 535B 的“英雄训练(Hero Run)”之前,团队先公开训练了从 1.6B、27.7B 逐步递进的 4 个阶段模型,用小规模实验的数据提前校准并预测 535B 主模型的收敛表现; 2. MoE 动态特性的实时切片: 在刚刚开始的几百个 Step 里,社区网友立刻捕捉到了参数范数(Norms)在第 500 Step 附近的异常尖峰,并自发在 GitHub Issue 中排查出原因:这是 MoE 路由偏置(`router_bias`)在执行 Token 负载均衡算法时的非梯度动态波动,而非模型训练发散; 3. 真实世界的“炸炉”容错: 792 颗 GB200 集群在连续 3 个月的满载运行中,必然会遇到不可避免的硬件故障与通讯重试。把每一次崩溃现场、断点续训(Checkpointing)和恢复策略公之于众,给整个 AI 社区提供了价值数千万美元的超大规模分布式训练实战教科书。
真正的开源不是给权重,而是公开“成长的代价”
很多人把开源理解为“大厂把训好的权重打个 zip 包丢上 Hugging Face”。
但这其实是一种有保留的开源: – 你拿到了结果,但你依然不知道这颗“大脑”在 18 万亿 Token 的投喂中,经历了哪些认知的畸变与重塑; – 你不知道哪些数据配比会导致模型产生灾难性遗忘,哪些超参数能在千亿规模下维持稳定。
Marin 项目正在定义一种全新的开源标准:过程可观察、工程可复现、失败可讨论。
当模型训练不再是几个顶尖实验室暗室里的特权魔法,而是像 Linux 内核、开源编译器一样接受全球数万名开发者的共同审计与推演时,整个行业的研发效率将被成倍放大。
Kate 的观点与判断
对于这场划时代的 535B 训练直播,我有三点极客判断:
1. “玄学炼丹”正在加速向“重工业工程学”演进。过去大模型训练被过度神话,仿佛掌握了不可告人的秘方。当数据配比、训练配置和实时监控全部开源透明后,行业会发现大模型预训练本质上就是极其扎实的分布式系统工程、数据清洗管线与数值稳定性控制。 2. 给高校与独立研究者的强心针。面对动辄数亿美元的闭源算力壁垒,中小型实验室根本无力承担试错成本。Marin 提供的实时公开数据与 Scaling 预测模型,将成为全球 AI 研究者分析巨型 MoE 训练动态的宝贵公开实验室。 3. 闭源巨头的“信息差护城河”正在加速瓦解。当越来越多像 Marin、DeepSeek 这样连同底层工程细节全盘托出的项目出现时,闭源大厂仅靠“保密”筑起的技术神秘感将不复存在。谁能在透明的阳光下把工程效率做到极致,谁才能真正赢得未来。
欢迎来到大模型的“真人秀”时代。坐在屏幕前看着一行行代码和浮点运算构建出智能的大脑,这才是技术该有的浪漫与尊严。