如果把训练数据增加 100 倍,机器人会不会开始做成原先做不到的事?
对于具身世界模型,这个问题指向一种可能:大语言模型身上那条“规模增长,能力随之提升”的 Scaling 路径,能否在机器人身上走通。
最近,智元发布的原生世界—动作模型 GE-Act 2.0,把这个问题变成了一组具体实验:将最后一阶段的训练数据从 300 小时增加到 3 万小时,观察机器人的能力怎样变化。
GE-Act 2.0 尝试的路线,是先预测任务执行过程中可能出现的未来视觉状态,再根据这些预测生成动作。其中,未来生成器和动作模型从随机初始化开始,在具身操作数据上预训练。
预训练完成后,模型直接在新场景、新物体上接受测试,不针对评测任务额外微调,也不提供额外示范。团队用 100 项原子任务、20 类技能、两种机器人本体,检验预训练带来的零样本操作能力。
结果显示,随着数据规模扩大 100 倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作,原生世界—动作模型的 Scaling 路径首次被系统性验证。
四档训练数据量(300 / 1,200 / 5,000 / 30,000 小时)下的任务表现:随着数据规模扩大,取得非零成功率的任务增多,整体成功率同步上升。
项目主页及论文:https://ge-act-v2.github.io/
原文链接:从300小时到3万小时,机器人到底学会了什么?世界模型GE-Act 2.0的Scaling实验
01 换一个场景,还能不能做?检验预训练的泛化能力
先看这组实验怎么测。
假设机器人接下来要整理桌面,我们可以先围绕桌子采集数据,再针对这个任务微调。模型的成绩很可能会变好,但这个结果,很难说明是模型对这个环境熟悉所以执行任务变好,还是它本身产生的智能带动结果变好。
GE-Act 2.0 关注的是:预训练结束以后,换一张桌子、换一批物体,机器人自己还能做到哪一步?
所以,这组实验以真机零样本(Zero-shot)表现作为核心评测指标。按团队的测试设置,场景、背景、光照和物体实例都没有出现在训练中,模型也不为这些评测任务额外微调或接受示范。
之后,团队沿用同一训练配方,将最后一阶段的联合训练数据设为 300、1,200、5,000 和 30,000 小时。每项任务在每种本体、每档数据规模下测试 10 次。随着数据增加,三种变化逐渐清晰:
**能做成的任务,开始变多。**取得非零成功率的任务,在 G1-OP 上从 39 项增至 76 项,在 G2-90D 上从 24 项增至 72 项。前面提到的折毛巾、嵌套纸杯等操作,在 G1-OP 的小数据规模测试中没有成功,到 3 万小时规模时出现了成功案例。整体成功率更高。G1-OP 从 17.1% 提升至 44.1%,G2-90D 从 13.4% 提升至 31.1%。从 5,000 小时继续增加到 30,000 小时,两种本体仍有提升,说明这组实验中增加数据的收益还在持续。
**数据少的本体也在受益。**G1-OP 贡献了超过 50% 的训练数据,G2-90D 的占比不足 2%,后者的总体成功率仍随共享数据扩大提升了 17.7 个百分点。这为通过共享训练实现跨本体迁移,提供了一个积极信号。
随着训练数据规模扩大,两种本体的多数技能持续提升。
零样本之外,团队还报告了微调后的基准测试:GE-Act 2.0 在 RoboTwin Hard 陌生环境测试中的成功率为 60.52%,在 GenieSim 指令遵循测试中的归一化平均分为 0.770,均高于 π0.5、GR00T N1.7 等参与比较的模型。
02 先预测未来,再生成动作,这件事怎么一起学?
看完结果,再看模型如何进行预训练。
假设我们告诉机器人:“把桌上的杯子拿起来。”传统动作模型会直接根据眼前的画面和这条指令,决定机械臂接下来怎么动。
GE-Act 2.0 在中间多加了一步:先预测拿起杯子时可能出现的未来画面,再让逆动力学模型(IDM)根据当前和未来的状态,推断应该执行什么动作。
世界模型预测的未来因此成为动作生成的依据。
已有的 WAM 路线,很多会从预训练视频生成器出发,再接入动作模型。这样可以借助视频模型已经学到的生成能力。GE-Act 2.0 则面向具身操作重新设计视觉表征,并从头预训练未来生成器和动作模型,尝试让这几部分一起随着数据规模增长。
但把它们放进同一套架构,还只是开始。画面怎么表示,未来怎么生成,预测和动作怎么对得上,都有具体问题要解决。
GE-Act 2.0 架构:压缩当前画面,预测未来视觉状态,再由逆动力学模型生成动作。
原生高效表征:一帧画面压缩为 24 个 token
机器人既要看清物体和运动,又要控制计算成本。
以模型使用的 256×384 输入为例,一帧就有近 10 万个像素。后面的模型还要拿着从画面里提取的信息,一次次预测未来、生成动作。这份视觉表示越大,训练和推理的负担也就越重。
但对操作来说,杯子在哪里、手在怎么移动,这些信息又不能随便丢掉。
GE-Act 2.0 为此设计了视觉编码器 CoAE,把一帧画面压缩成 24 个视觉 token,数量只有 DINOv3 的十六分之一,同时保留语义、运动和局部结构信息。
那么问题来了,压缩以后,这些信息还够不够机器人判断动作?
论文做了两组检查。在动作恢复测试中,CoAE 的误差与 DINOv3、V-JEPA 2.1 等表征接近;在基于 5,000 条 GenieSim-Instruction 操作轨迹构建的受控测试中,指令—画面匹配准确率达到 97.95%,为五种对照表征中最佳。
也就是说,模型处理的视觉 token 大幅减少了,而这些测试所考察的动作信息和指令匹配能力,仍然得到了保留。后面的未来预测,也就有了一份更紧凑的视觉输入。
原生视觉规划器:让“怎么做”的误差,反馈给“怎么预测”
画面压缩之后,下一步是把世界模型和动作模型连起来。
世界模型预测拿起杯子的过程,IDM 根据这些未来状态生成动作。如果生成的动作有偏差,训练时就要把误差信号传回去,让前面的未来预测也能跟着调整。
问题出在这条训练链路的长度上。传统视频生成器往往需要多轮去噪,才能生成完整的未来。动作误差要穿过这段生成过程,计算和显存开销都会增加;实际推理时,机器人也需要等得更久。
GE-Act 2.0 的做法是一步式视觉规划:一次前向计算,就生成规划需要的未来视觉状态。这样,动作训练的误差信号也能通过预测结果,反馈给世界模型。
模型学习怎么行动的时候,也在学习怎样预测一个更有助于行动的未来。
这也带来了推理速度上的收益。据团队提供的测试数据,配合紧凑的视觉表征,GE-Act 2.0 在 RTX 5090 上生成一段连续动作(action chunk),耗时 104 毫秒。
联合训练方案:未来看着合理,动作却可能对不上
即便两个模型已经连起来,训练也未必就顺了。
还是拿杯子。指令只说“拿起来”,没有指定用哪只手。世界模型预测的是左手抓取,训练数据记录的却是右手抓取。
左手可以拿,右手也可以拿。两种做法分别看都说得通,但如果拿右手的动作去监督左手抓取的未来画面,训练信号就冲突了。
GE-Act 2.0 因此引入知识对齐选择性优化(KASO)。它让模型先预测几个可能的未来,再由动作模型判断:哪一个未来,和这条训练轨迹里的动作更一致?选出这个结果,再参与联合训练。
**关键在于,预测的未来能否对应上正在学习的动作。**所以 KASO 在动作空间里做比较,仅仅看两张画面像不像,还不足以作出选择。
论文在 G2-90D 上做了陌生场景(OOD)的四物体抓取消融测试。使用 300 小时数据进行联合训练时,相比直接端到端联合训练基线,KASO 让机器人选对指令目标的比例提高了 7.5 个百分点,完成抓取的成功率提高了 10 个百分点。
预测与动作之间这处容易被忽略的错位,最终影响的是机器人能不能把任务做好。
KASO 从多个预测未来中,选择与真实动作最一致的结果用于联合训练,减少未来预测与动作监督的错位。
03 遥操、无本体、Rollout、失败轨迹,这些数据怎么用起来?
说到这里,话题还要回到数据。
机器人训练和部署过程中留下的记录,往往没有那么整齐。有的视频拍下了人怎么操作,却没有机器人动作标注;有的轨迹记录了机器人怎么动,却没有文字指令;还有一些,记录的就是一次失败。
如果训练只接受带指令的成功示范,这些数据就很难充分利用。可它们里面明明还保留着不少信息:物体怎样移动,手做了什么,动作之后画面发生了怎样的变化。
GE-Act 2.0 把这些数据安排进了三个训练阶段。
**世界模型先看视频,学习环境会怎样变化。**这个阶段使用 3.9 万小时“指令—视频”数据,其中包含 3,000 小时无本体数据,也就是没有机器人动作标注的第一视角与人类操作视频。视频能呈现操作过程,因此即使缺少动作标注,也可以用来预训练世界模型。
**IDM 从轨迹里学:画面这样变,机器人做了什么?**这个阶段使用 3.2 万小时带动作记录的机器人轨迹,其中包含 2,000 小时失败操作与部署回流(rollout)数据。IDM 根据操作前后的画面预测动作,再用实际动作记录作监督。只要这些对应关系还在,就不要求轨迹额外带有文字指令或成功标签。
**再用完整数据,把预测未来和生成动作连起来。**最后使用 3 万小时“指令—视频—动作”数据联合训练,让世界模型和 IDM 一起优化。前面从 300 小时到 3 万小时的 Scaling 实验,改变的就是这一阶段的数据量。
这三个阶段的数据池存在重叠,小时数不能直接相加。但它们说明了一件事:不同完整程度的数据,可以分别用来学习不同的能力。
失败轨迹的价值,也就好理解了。比如一次抓取没有完成,机器人执行了哪些动作、画面随之发生了什么变化,仍然被记录了下来。IDM 可以继续从这些对应关系里学习。
任务失败了,这段经历里仍然有可用的信息。
对于持续产生部署数据的团队,这也是一个很实际的方向:让机器人每次执行留下的记录,有更多机会进入下一轮训练。
分阶段预训练
04 写在最后
再回到开头那个问题:数据从 300 小时增加到 3 万小时,机器人会多学会些什么?
GE-Act 2.0 给出的结果是,能做成的任务变多了,整体成功率提高了,数据占比少的本体也出现了明显进步。而在这组结果背后,视觉表征、未来预测、动作生成和数据利用,都需要为同一件事配合起来:让机器人学到的东西,最终能够用到操作上。