news 2026/10/1 10:05:22

从300小时到3万小时,机器人到底学会了什么?世界模型GE-Act 2.0的Scaling实验

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从300小时到3万小时,机器人到底学会了什么?世界模型GE-Act 2.0的Scaling实验

如果把训练数据增加 100 倍,机器人会不会开始做成原先做不到的事?

对于具身世界模型,这个问题指向一种可能:大语言模型身上那条“规模增长,能力随之提升”的 Scaling 路径,能否在机器人身上走通。

最近,智元发布的原生世界—动作模型 GE-Act 2.0,把这个问题变成了一组具体实验:将最后一阶段的训练数据从 300 小时增加到 3 万小时,观察机器人的能力怎样变化。

GE-Act 2.0 尝试的路线,是先预测任务执行过程中可能出现的未来视觉状态,再根据这些预测生成动作。其中,未来生成器和动作模型从随机初始化开始,在具身操作数据上预训练。

预训练完成后,模型直接在新场景、新物体上接受测试,不针对评测任务额外微调,也不提供额外示范。团队用 100 项原子任务、20 类技能、两种机器人本体,检验预训练带来的零样本操作能力。

结果显示,随着数据规模扩大 100 倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作,原生世界—动作模型的 Scaling 路径首次被系统性验证。

四档训练数据量(300 / 1,200 / 5,000 / 30,000 小时)下的任务表现:随着数据规模扩大,取得非零成功率的任务增多,整体成功率同步上升。

项目主页及论文:https://ge-act-v2.github.io/

原文链接:从300小时到3万小时,机器人到底学会了什么?世界模型GE-Act 2.0的Scaling实验

01 换一个场景,还能不能做?检验预训练的泛化能力

先看这组实验怎么测。

假设机器人接下来要整理桌面,我们可以先围绕桌子采集数据,再针对这个任务微调。模型的成绩很可能会变好,但这个结果,很难说明是模型对这个环境熟悉所以执行任务变好,还是它本身产生的智能带动结果变好。

GE-Act 2.0 关注的是:预训练结束以后,换一张桌子、换一批物体,机器人自己还能做到哪一步?

所以,这组实验以真机零样本(Zero-shot)表现作为核心评测指标。按团队的测试设置,场景、背景、光照和物体实例都没有出现在训练中,模型也不为这些评测任务额外微调或接受示范。

之后,团队沿用同一训练配方,将最后一阶段的联合训练数据设为 300、1,200、5,000 和 30,000 小时。每项任务在每种本体、每档数据规模下测试 10 次。随着数据增加,三种变化逐渐清晰:

  • **能做成的任务,开始变多。**取得非零成功率的任务,在 G1-OP 上从 39 项增至 76 项,在 G2-90D 上从 24 项增至 72 项。前面提到的折毛巾、嵌套纸杯等操作,在 G1-OP 的小数据规模测试中没有成功,到 3 万小时规模时出现了成功案例。整体成功率更高。G1-OP 从 17.1% 提升至 44.1%,G2-90D 从 13.4% 提升至 31.1%。从 5,000 小时继续增加到 30,000 小时,两种本体仍有提升,说明这组实验中增加数据的收益还在持续。

  • **数据少的本体也在受益。**G1-OP 贡献了超过 50% 的训练数据,G2-90D 的占比不足 2%,后者的总体成功率仍随共享数据扩大提升了 17.7 个百分点。这为通过共享训练实现跨本体迁移,提供了一个积极信号。

随着训练数据规模扩大,两种本体的多数技能持续提升。

零样本之外,团队还报告了微调后的基准测试:GE-Act 2.0 在 RoboTwin Hard 陌生环境测试中的成功率为 60.52%,在 GenieSim 指令遵循测试中的归一化平均分为 0.770,均高于 π0.5、GR00T N1.7 等参与比较的模型。

02 先预测未来,再生成动作,这件事怎么一起学?

看完结果,再看模型如何进行预训练。

假设我们告诉机器人:“把桌上的杯子拿起来。”传统动作模型会直接根据眼前的画面和这条指令,决定机械臂接下来怎么动。

GE-Act 2.0 在中间多加了一步:先预测拿起杯子时可能出现的未来画面,再让逆动力学模型(IDM)根据当前和未来的状态,推断应该执行什么动作。

世界模型预测的未来因此成为动作生成的依据。

已有的 WAM 路线,很多会从预训练视频生成器出发,再接入动作模型。这样可以借助视频模型已经学到的生成能力。GE-Act 2.0 则面向具身操作重新设计视觉表征,并从头预训练未来生成器和动作模型,尝试让这几部分一起随着数据规模增长。

但把它们放进同一套架构,还只是开始。画面怎么表示,未来怎么生成,预测和动作怎么对得上,都有具体问题要解决。

GE-Act 2.0 架构:压缩当前画面,预测未来视觉状态,再由逆动力学模型生成动作。

原生高效表征:一帧画面压缩为 24 个 token

机器人既要看清物体和运动,又要控制计算成本。

以模型使用的 256×384 输入为例,一帧就有近 10 万个像素。后面的模型还要拿着从画面里提取的信息,一次次预测未来、生成动作。这份视觉表示越大,训练和推理的负担也就越重。

但对操作来说,杯子在哪里、手在怎么移动,这些信息又不能随便丢掉。

GE-Act 2.0 为此设计了视觉编码器 CoAE,把一帧画面压缩成 24 个视觉 token,数量只有 DINOv3 的十六分之一,同时保留语义、运动和局部结构信息。

那么问题来了,压缩以后,这些信息还够不够机器人判断动作?

论文做了两组检查。在动作恢复测试中,CoAE 的误差与 DINOv3、V-JEPA 2.1 等表征接近;在基于 5,000 条 GenieSim-Instruction 操作轨迹构建的受控测试中,指令—画面匹配准确率达到 97.95%,为五种对照表征中最佳。

也就是说,模型处理的视觉 token 大幅减少了,而这些测试所考察的动作信息和指令匹配能力,仍然得到了保留。后面的未来预测,也就有了一份更紧凑的视觉输入。

原生视觉规划器:让“怎么做”的误差,反馈给“怎么预测”

画面压缩之后,下一步是把世界模型和动作模型连起来。

世界模型预测拿起杯子的过程,IDM 根据这些未来状态生成动作。如果生成的动作有偏差,训练时就要把误差信号传回去,让前面的未来预测也能跟着调整。

问题出在这条训练链路的长度上。传统视频生成器往往需要多轮去噪,才能生成完整的未来。动作误差要穿过这段生成过程,计算和显存开销都会增加;实际推理时,机器人也需要等得更久。

GE-Act 2.0 的做法是一步式视觉规划:一次前向计算,就生成规划需要的未来视觉状态。这样,动作训练的误差信号也能通过预测结果,反馈给世界模型。

模型学习怎么行动的时候,也在学习怎样预测一个更有助于行动的未来。

这也带来了推理速度上的收益。据团队提供的测试数据,配合紧凑的视觉表征,GE-Act 2.0 在 RTX 5090 上生成一段连续动作(action chunk),耗时 104 毫秒。

联合训练方案:未来看着合理,动作却可能对不上

即便两个模型已经连起来,训练也未必就顺了。

还是拿杯子。指令只说“拿起来”,没有指定用哪只手。世界模型预测的是左手抓取,训练数据记录的却是右手抓取。

左手可以拿,右手也可以拿。两种做法分别看都说得通,但如果拿右手的动作去监督左手抓取的未来画面,训练信号就冲突了。

GE-Act 2.0 因此引入知识对齐选择性优化(KASO)。它让模型先预测几个可能的未来,再由动作模型判断:哪一个未来,和这条训练轨迹里的动作更一致?选出这个结果,再参与联合训练。

**关键在于,预测的未来能否对应上正在学习的动作。**所以 KASO 在动作空间里做比较,仅仅看两张画面像不像,还不足以作出选择。

论文在 G2-90D 上做了陌生场景(OOD)的四物体抓取消融测试。使用 300 小时数据进行联合训练时,相比直接端到端联合训练基线,KASO 让机器人选对指令目标的比例提高了 7.5 个百分点,完成抓取的成功率提高了 10 个百分点。

预测与动作之间这处容易被忽略的错位,最终影响的是机器人能不能把任务做好。

KASO 从多个预测未来中,选择与真实动作最一致的结果用于联合训练,减少未来预测与动作监督的错位。

03 遥操、无本体、Rollout、失败轨迹,这些数据怎么用起来?

说到这里,话题还要回到数据。

机器人训练和部署过程中留下的记录,往往没有那么整齐。有的视频拍下了人怎么操作,却没有机器人动作标注;有的轨迹记录了机器人怎么动,却没有文字指令;还有一些,记录的就是一次失败。

如果训练只接受带指令的成功示范,这些数据就很难充分利用。可它们里面明明还保留着不少信息:物体怎样移动,手做了什么,动作之后画面发生了怎样的变化。

GE-Act 2.0 把这些数据安排进了三个训练阶段。

  • **世界模型先看视频,学习环境会怎样变化。**这个阶段使用 3.9 万小时“指令—视频”数据,其中包含 3,000 小时无本体数据,也就是没有机器人动作标注的第一视角与人类操作视频。视频能呈现操作过程,因此即使缺少动作标注,也可以用来预训练世界模型。

  • **IDM 从轨迹里学:画面这样变,机器人做了什么?**这个阶段使用 3.2 万小时带动作记录的机器人轨迹,其中包含 2,000 小时失败操作与部署回流(rollout)数据。IDM 根据操作前后的画面预测动作,再用实际动作记录作监督。只要这些对应关系还在,就不要求轨迹额外带有文字指令或成功标签。

  • **再用完整数据,把预测未来和生成动作连起来。**最后使用 3 万小时“指令—视频—动作”数据联合训练,让世界模型和 IDM 一起优化。前面从 300 小时到 3 万小时的 Scaling 实验,改变的就是这一阶段的数据量。

这三个阶段的数据池存在重叠,小时数不能直接相加。但它们说明了一件事:不同完整程度的数据,可以分别用来学习不同的能力。

失败轨迹的价值,也就好理解了。比如一次抓取没有完成,机器人执行了哪些动作、画面随之发生了什么变化,仍然被记录了下来。IDM 可以继续从这些对应关系里学习。

任务失败了,这段经历里仍然有可用的信息。

对于持续产生部署数据的团队,这也是一个很实际的方向:让机器人每次执行留下的记录,有更多机会进入下一轮训练。

分阶段预训练

04 写在最后

再回到开头那个问题:数据从 300 小时增加到 3 万小时,机器人会多学会些什么?

GE-Act 2.0 给出的结果是,能做成的任务变多了,整体成功率提高了,数据占比少的本体也出现了明显进步。而在这组结果背后,视觉表征、未来预测、动作生成和数据利用,都需要为同一件事配合起来:让机器人学到的东西,最终能够用到操作上。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 10:03:29

Recuris:面向长时序智能体框架的递归式经验‑工作记忆演化

Recuris:面向长时序智能体框架的递归式经验‑工作记忆演化 论文原始信息:arXiv:2608.24876v1 摘要 递归自我提升(RSI)在长时序任务中落地难度很高:持续膨胀的交互历史会模糊任务真实状态,造成技能调用错位。本文提出Recuris,一套面向长时序智能体框架的递归经验‑工作记…

作者头像 李华
网站建设 2026/10/1 10:02:28

LSTM电力负荷预测实战:基于PyTorch从预处理到滚动预测

简介:基于PyTorch实现一个简单LSTM模型进行电力负荷预测,适合深度学习初学者、电力系统分析人员及时间序列建模爱好者参考。压缩包共14个文件,含5个csv电力负荷数据集、5个Python脚本、1个训练好的pt权重文件、1份Markdown项目说明及少量缓存…

作者头像 李华
网站建设 2026/10/1 10:02:23

Keil MDK下载安装全指南:版本选择与Pack包管理实战

1. 下载Keil MDK之前,先搞清楚你要的到底是哪个Keil很多人一上来就搜“keil下载”,搜完之后反而懵了——页面上有好几个下载入口,什么MDK-ARM、C51、C251、Vision,点进去又发现有不同的版本号,到底该下哪个&#xff1f…

作者头像 李华
网站建设 2026/10/1 10:01:21

状态空间模型SSM实战指南:从Mamba选型到长文本工程落地

最近在做长文档问答项目时,被一份百万token级的合同文本折磨得焦头烂额。用常规Transformer模型跑一次全量注意力,显存直接OOM;用滑窗吧,跨章节的关联信息又抓不住;后来试着把主干换成状态空间模型(SSM&…

作者头像 李华
网站建设 2026/10/1 10:01:12

WorkBuddy 实验记录:照片、参数、结论自动归档,复现实验终于不靠回忆

WorkBuddy 实验记录:照片、参数、结论自动归档,复现实验终于不靠回忆 [!NOTE] 实验做完才补记录,常会丢失样本编号、仪器设置和异常过程。WorkBuddy 可以协助整理,但原始数据与时间戳必须保持不可篡改。 本课不会用“AI 一键完成”制造错觉,而是把 WorkBuddy、Python 3.11…

作者头像 李华
网站建设 2026/10/1 10:00:11

自建Asterisk VoIP服务器:从云PBX账单到开源电话系统的完整落地指南

说实话,我第一次认真考虑自建VoIP服务器Asterisk,不是出于折腾的兴趣,而是被一张云PBX账单刺激到了。公司一百多号人,分机总数不过五十,每月给托管电话系统交的费用够买好几台正经服务器了。后来我一算,用一…

作者头像 李华