news 2026/10/3 6:15:39

专家池 8→128 只慢 5%:Ai2 开源万亿参数 MoE 训练框架 Olmo-core 3

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
专家池 8→128 只慢 5%:Ai2 开源万亿参数 MoE 训练框架 Olmo-core 3

💡一句话总结:非营利机构 Ai2 于 10 月 1 日开源Olmo-core 3——一套重写过的 MoE(混合专家)训练系统:8 张 B300 上吞吐约 2.7 倍于旧实现、512 卡验证 1.2 万亿参数模型、MXFP8 低精度再提速 21%。它不是新模型,而是下一代 Olmo 的训练基座,也是目前 Megatron-Core 之外少有的开放替代。

先从一个扎心的现实说起:大模型训练的成本曲线,这几年基本把学术实验室挤出了牌桌——参数量上去,卡和电费按亿美元计,能玩万亿参数训练的只剩少数大厂。MoE(混合专家架构,总参数很大但每个输入只激活一小部分「专家」)本来是省算力的希望,但它有个隐蔽的坑:专家越多,把数据路由给正确专家的通信与调度成本越高,省下来的算力红利又被吃回去。

10 月 1 日,Ai2 把补这个洞的整套方案开源了。

想自己动手或查证?

  • 📄 官方公告:Hugging Face Blog · allenai/olmocore3
  • 💻 代码:GitHub · allenai/olmo-core
  • 📊 技术报告:allenai.org/papers/olmocore3
  • 🎮 交互式讲解:narrative.allen.ai/scaling-up-training

先说清它是什么:训练框架,不是新模型

容易混淆的点先澄清:Olmo-core 3不是模型权重。Ai2 的 Olmo 系列里,OlmoE 是 64 专家的 MoE 模型,2025 年 11 月的 Olmo 3 反而转回了密集架构;而 Olmo-core 3 是这一切下面的训练基础设施——下一代 Olmo 将确定采用 MoE 架构,用 Ai2 最大的数据集和最长的上下文窗口,训练栈就是这套新框架。

也就是说,这是一个「把方法先于模型公开」的发布:万亿参数 MoE 怎么训,牌先亮出来,模型后到。

关键数字:2.7 倍吞吐是怎么来的

上一代 Olmo-core 的 MoE 实现用 FSDP(全分片数据并行,每批数据都要把权重聚集再分片一遍),批次一多,搬运权重的开销就成了大头。Olmo-core 3 换成 DDP(分布式数据并行)思路:专家常驻在各自的 GPU 上不动,把数据路由过去。

效果用一组受控对比说最清楚:专家池从 8 个扩到 128 个,每个 token 仍只激活 4 个专家,单 token 激活参数稳定在约 32 亿——总容量从 46 亿拉到 470 亿(10 倍),训练吞吐却只下降不到 5%。在 8 张 NVIDIA B300 的初步测试中,这个 470 亿参数的 MoE 跑到每卡每秒 52,000 token,旧实现只有 19,400。

这里需要澄清一句口径: trillion 级的数字来自「随机路由」的系统基准,测的是基础设施性能而非训练出的模型质量;512 卡跑通的 1.2 万亿参数模型(每 token 激活 583.6 亿)观测到最高每卡 858 TFLOP/s。数字是框架能力的天花板展示,持续训练表现要看下一代 Olmo 的实际训练。

三招拆分、三项优化、一个精度开关

具体怎么把大 MoE 摊到集群上,框架用了三层拆分加一组路由优化:

  • 🧩专家并行:每张卡只存一部分专家池;
  • 🔗流水线并行:把模型分层切给不同 GPU 组;
  • 💾分布式优化器:优化器状态不再每卡存全量副本。

路由侧的省钱三件套:行式专家并行把数据直接摆进专家输入缓冲区、GPU 常驻路由让 CPU 排活不用等元数据拷回、分组 GEMM 把小而多的专家计算合并批量执行。再叠加MXFP8低精度格式开关——4 卡受控测试里端到端吞吐比 BF16 高约 21%,峰值活动显存从 103 GiB 降到 95 GiB,收益主要来自前馈计算和专家间数据搬运,而不是注意力。

难得的是,失败实验也一起交了

技术报告里最有价值的部分,恰恰是「试过但没采用」的路径:

  • 一个本意鼓励负载均衡的评分,可能在真实负载变得更不均衡时反而「变好看」——Ai2 称之为token gerrymandering(token 分配舞弊);
  • 因为专家处理的 token 少就调低其学习率,在测试的模型族里没有带来改善;
  • 相同矩阵维度下,GPU 计算耗时随输入数值变化,性能对比必须对齐输入值与形状;
  • 通信与计算分流重叠并不总能加速,某些测试里反而拖慢端到端执行。

对要自己搭训练栈的团队,这些负结果可能比 2.7 倍的正面数字更省真金白银——别人踩过的坑直接绕开。

这事跟你有多大关系?

分三类读者说:

  • 🎓要训(而非微调)大模型的实验室/团队:这是目前 NVIDIA 生态里 Megatron-Core 之外少有的开放替代,且经过 512 卡验证、连工程决策记录都公开。但注意门槛:「有框架」不等于「训得起」——万亿参数的真实成本仍以亿美元计,512 张 B300 本身就是多数团队的全部算力预算。
  • 🏗️做推理/训练 infra 的工程师:报告里关于通信重叠、精度格式、路由开销的实测结论,直接可借鉴到自家系统的调优决策里。
  • 📱纯应用层开发者:短期影响有限。间接影响是下一代 Olmo(开源阵营里透明度最高的系列之一)的成型速度,以及「训练栈公共品化」这个行业趋势——同周 DeepSeek 开源了昇腾平台的六个训练组件,两大生态在同一个星期把训练基础设施摆上了开源货架。

把话说明白:这次发布没有争议、数字口径也诚实(官方自己标注了随机路由的测试性质),真正值得玩味的是趋势——开放的边界从模型权重、数据配方,推进到了训练基础设施本身。模型能力的差距会不会从「谁有钱」慢慢转向「谁会调」?下一代 Olmo 出来之前,这个问题没有答案,但入场券确实发出去了。

参考来源

  • Ai2 官方公告(一手):Introducing Olmo-core 3 | Ai2 Blog
  • Hugging Face 同步发布(一手):HF Blog · allenai/olmocore3
  • 技术报告(一手):allenai.org/papers/olmocore3
  • Unite.AI 行业报道:Ai2 Releases Olmo-Core 3
  • 中文解读:梭哈 AI · Ai2 开源 Olmo-core 3、Agent E 报告
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 6:15:39

不同厂商大模型API格式不一样怎么统一调用:五大差异与三种方案

2026年国产大模型进入百家争鸣阶段:DeepSeek擅长推理、通义千问擅长中文创作、豆包擅长多轮对话、可灵擅长视频生成,实际项目往往要同时接入三到五个模型。但后端工程师对接一个厂商少则半天多则两天,对接五家约需两周——差异究竟差在哪、怎…

作者头像 李华
网站建设 2026/10/3 6:15:29

数学艺术图案画-曼陀罗(92)

数学艺术图案画-曼陀罗(92) 本系列曼陀罗图案创制一直以来都是我的最爱。我总是被色彩绚烂和美轮美奂的图案感动。 在前些时候完成了曼陀罗图案系列 9 轮既定目标,( 图1)至( 图 90)。…

作者头像 李华
网站建设 2026/10/3 6:15:19

美妆批发一手货源网怎么选不踩坑?十年车间老炮揭秘验厂选品底牌

拿着手机翻一晚上“美妆批发一手货源网”,看到的价格一个比一个离谱。抱着试探的心态打过去,对面连个像样的生产车间都报不出来,只会甩一句“量大从优、支持混批”。干了这么多年车间,我先把话撂这儿:你在网页上刷到的…

作者头像 李华
网站建设 2026/10/3 6:13:46

production-ready-secure-data-tool

A simple, secure, production-ready AI data tool. Topics: security production best-practices zero-config ai-powered easy-deploy enterprise 目录 production-ready-secure-data-tool/ ├── .env ├── .github/ │ └── workflows/ │ └── deploy.…

作者头像 李华