一个机器人伸手去拿桌边的杯子。
半秒前,它看到杯子还在桌沿。半秒后,有人把杯子往里推了几厘米。如果它只是记住了上一帧画面,动作会非常准确地伸向一个已经不存在的位置;如果它能理解“我这一伸手之后,世界会怎样变化”,它才有机会停下来、重算路径,甚至换一种抓取方式。
对视频生成模型来说,这只是画面连续性问题。对机器人来说,这是一次会不会失败的行动。
世界模型真正的分野,就藏在这半秒里:它到底是在生成一个看起来合理的世界,还是在为一次动作之后的世界承担预测责任?
原文链接:世界模型的定义虽然很乱,但闭环正在收拢。
01 我们听到的世界模型可能压根不是一类。
今年 6 月,李飞飞教授与 World Labs 团队发布《A Functional Taxonomy of World Models》,试图给越来越拥挤的“世界模型”概念画一张地图。
从经典的 POMDP 框架出发,按系统“输出什么”把世界模型分成三类:输出像素的渲染器、输出几何与物理状态的模拟器,以及输出动作的规划器。
两个月后,来自清华大学的研究学者发布了技术报告《General World Models from First-Principles》。
这篇工作不再从现有产品出发做归类,而是从第一性原理追问:一个世界模型要走向“通用”,内部究竟需要具备哪些能力?
前一篇按模型的输出功能整理现状,后一篇沿着理解、预测、行动与反馈推演路线。两篇工作一前一后,刚好把今天世界模型的分歧展开了。
这背后也暴露了一个行业越来越难回避的问题:今天大家说的“世界模型”,可能压根不是同一种东西。
视频生成、3D、自动驾驶和机器人团队都在用世界模型。
成果物可以是一段逼真的视频、一座能实时探索的数字空间、一套机器人训练环境,也可以是智能体脑中用于预测与规划的内部模型。
看上去都在“构建世界”,但解决的问题,却相差很远。
视频生成模型学习的是像素随时间变化的规律。它要保持人物、场景和运动连续,让一段从未发生过的视频看起来足够合理。
交互式世界生成模型再往前走一步。用户可以改变视角、移动角色或持续输入指令,模型据此生成后续环境。这里的关键,从一次性生成变成了状态能否持续、输入能否即时改变未来。
机器人领域的世界模型又是另一套要求。
它不只需要预测“下一帧长什么样”,还要预测夹爪向左移动两厘米、手腕旋转一个角度之后,物体会不会滑落、碰撞或偏离目标。预测最终要落到动作上,还要接受真实世界的检验。
三者之间并非泾渭分明:好的规划需要模拟行动后果,好的模拟也常常需要被渲染成人类或机器可读的观测。
那究竟应该怎么分类?好像之前一直没有标准。
02 混乱是因为行业初期,还是根本没有标准?
说到这,世界模型早就过了“因为太早,所以说不清”的阶段。
从自驾到大模型时代,再到现在具身,世界模型的声音根本就没断过。
今天真正缺的,是一套能够衡量视频生成、交互环境和机器人行动的共同能力坐标。
只是具身让这件事变得紧迫罢了。
近日,生数科技在《General World Models from First-Principles》中给出 L1—L5 五级路线:从生成世界、与世界交互、在世界中行动,一直走向自主世界智能体和世界组织者。
这套分级还不算行业标准,但它提供了一把有用的尺子——每升一级,模型都要把更多能力接进反馈回路。
看着这个表,L1 到 L3 的差别,我觉得用学习骑自行车这件事儿,可以讲得更明白。也对应我们常看到的几类世界模型。
所谓L1,就是让模型先坐在路边看,理解骑车这件事应该是怎么样的?如何上车、怎么样会摔倒?解释的是骑车这件事通常怎样展开?
如果中间有人突然插入你骑行的轨迹 or 有人喊你应该换种骑法,L2可以根据新输入改变后续画面。世界由此从一次性结果,变成一个会回应的过程。
真正的门槛出现在 L3。
看过再多骑车视频,也不等于掌握平衡。只有坐上车,转一次车把、踩一下刹车,身体与道路才会共同改写下一秒;一旦失衡,还要根据新的反馈把车救回来。
到了这一层,模型的动作进入世界,世界的变化又反过来修正动作。
他们的Vidu Q3就是L1级别,Vidu S1 对应L2,Motubrain就是WAM(L3)level。
不过即使到L3,也只是让闭环有了一个可以观察的雏形,却没有回答规模化问题。
而WM想要在真实世界中转起来,绕不开三个核心问题。
1)世界知识怎样继续扩大?
2)不同模态与动作如何共享状态?
3)机器人不能等,需要实时反馈。
03 世界模型的闭环必须满足三个条件。
谈到闭环,后面的事情就比较工程了。
甚至这个工程纵深很大。
会做一次动作,只是起点。
本体换了、任务拉长、环境持续变化,单次成功很快就会失去意义。
世界模型的 scaling,必须同时发生在三个维度:知识覆盖继续扩大,视觉、语言和动作共享一个持续更新的状态,推理速度还要追上物理世界。
1)缺了底座,动作策略长不大;缺了塔尖,再丰富的想象也落不了地
世界模型(比如WAM这类结构)最先遇到的,是一笔很难算的数据账。
互联网上有近乎无限的视频。它们能告诉模型杯子会摔、液体会洒、人通常怎样完成一项任务,却很少记录“末端移动了多少、夹爪何时闭合”这些动作信息。
真机轨迹正好补上这一块。每一步动作和反馈都很清楚,可采集昂贵、规模有限,还常常与具体本体绑定。
一端有规模,一端有动作。
世界模型要把两者接进同一个闭环,需要一条从“看懂世界”逐步走向“用身体介入世界”的数据路径。
所以,训练世界动作模型不能陷入“视频还是机器人数据”的二选一。
这个data recipe很重要!
《General World Models from First-Principles》中提出的 D1—D5 数据金字塔,就是对这个问题的回答。
金字塔底部,D1 的互联网视频和 D2 的教学视频负责打开世界的广度:物体如何运动,任务通常怎样展开,人类又如何完成一件事。
到了 D3,视角从旁观者转向行动者。第一视角人类视频让模型开始从“我要怎么做”的位置观察环境。D4 再加入带动作记录的人类示范,把“做了什么”与“世界发生了什么变化”连接起来。
塔尖的 D5,才轮到真实机器人轨迹。它负责最后一步校准:这副机械臂能伸到哪里,夹爪怎样发力,已有的世界知识如何变成这具身体真正能执行的动作。
越往上,数据越少、越贵,动作与反馈却越来越密。金字塔的价值,就在于让不同数据各司其职。
视频教会模型世界通常怎样变化,真实交互教会模型这具身体能够怎样改变世界。
这也意味着,没有动作标注的视频依然有价值。逆动力学可以从前后状态变化中反推动作线索,潜空间预测与生成式建模可以学习动态规律。
有限的真机数据,则负责把这些规律对齐到具体本体。
我们了解到,Motubrain 还使用相对末端执行器动作表征,试图减少不同机械臂在关节空间上的差异。
按照他们之前披露的数据,模型可以利用50—100条目标机器人轨迹完成适配。
2)各类任务需要共享一个“不断更新的世界”
有了数据,下一道问题是怎么把它们接起来。
谁来保证视觉、语言和动作看到的是同一个世界?
机器人执行长程任务,最怕各个模块活在不同的“现在”里。
视觉刚刚看到杯子在桌边,语言模块记住的目标是“把杯子递给人”,规划模块也已经生成路径。可就在机器人伸手之前,杯子被人挪走了。如果动作模块仍沿用几秒前的状态,它会非常准确地走向一个错误的位置。
每个模块单独都对,机器人合起来却做错了。
模块化系统边界清晰、容易调试,至今仍有很强的工程价值。问题出现在任务变长、环境持续变化之后:感知、规划和控制之间传递的是一张张快照,而快照随时可能过期。
Mixture-of-Transformers(MoT),处理的正是这个问题。
让不同模态保留各自适配的参数结构,同时通过共享注意力交换上下文。视觉、语言和动作不再依靠层层转述,而是站在同一张白板前,看见同一个目标与环境变化。
于是,长程任务不再是一条写死的动作序列。
夹取落空,模型更新“物体仍在原位”;花瓶被挪动,目标位置随之改变。下一步动作从最新状态继续计算。
所以,闭环能否持续,关键就在于所有模块始终活在同一个“现在”。
3)实时反馈和大规模算力必不可少。
数据决定模型懂多少,架构保证几种能力活在同一个“现在”。
可到了机器人的端侧,还要再加一条:
这个“现在”,不能在推理结束前变成过去。
世界模型的 scaling 有一组天然矛盾。训练端希望模型更大、数据更多、理解更完整;机器人端却要求它在更短时间内完成观测、预测和动作更新。
离线生成一段视频,多等几秒通常没有影响。但在物理世界里,杯子可能正在滑动,目标也可能突然被人挪走。半秒前完全正确的判断,到了下一秒就可能变成错误动作。
因此,算力决定的不只是模型能学到多少,也决定闭环能不能及时转起来。
速度之外,动作还要保持连续。动作模型通常一次生成一段动作:等旧动作全部执行完再计算,机器人会停顿;中途直接切换,新旧动作又容易发生跳变。
之前我们分享过的生数那篇paper:《World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment》,其中讲到的Real-Time Chunking(RTC)正是在处理这段交接过程。
它让系统在机器人执行动作时,根据新观测滚动更新尚未完成的部分,同时处理新旧动作块的衔接。
机器人因此可以边行动、边观察、边调整。
数据扩大模型见过的世界,架构维持一个持续更新的世界,算力则让模型始终跟得上这个世界。
4)Motus2,则是整个闭环跑起来的 case
生数最新的 Motus2则提供了一个很值得观察的样本,朱军老师之前也分享过,可以理解为L3级别的进一步验证。
他们把这个工作定义为,用于灵巧操作的自演化通用世界模型:通过模型扩展和数据扩展不断改进。
而且是首次实现闭环自进化迭代,这一点就很接近L4。
同一模型既是策略(WAM)又是模拟器(AC-WM)还是评估器。
前面的条件,到了 Motus2 这里被落实了。
Motus2结构一览
模型上,用一套共享参数统一策略、模拟与评估,形成从动作提议、后果预测、结果判断到策略更新的闭环。
训练上,使用了约 13万小时第一人称人类数据, 涵盖单目、双目等多层次Ego数据。
还有一个需要注意的是,motus2对外表述的是常规数据用于训练WAM,次优和失败数据用于扩展。
闭环的价值这里就彰显了,我们不止一次说过失败数据的价值可能远超我们当下的应用。
此外,这次还加入了灵巧手。
部署了22/20高自由度触觉灵巧手(用的Sharpa、WUJI2),可实现类人的精细灵巧操作。通过机器人域的适配,并利用触觉反馈修正接触过程中的动作。
看了一下论文,报告的两项真机任务中,MBRL 与 Best-of-N Planning 将平均成功率从65%提高至75%。实验范围仍然有限,但已经验证了闭环对策略改进的作用。
不过,口径上,Motus2 可能仍处于 L3,但仍然是生数这家公司往L4迈出的很重要一步。
04 WM还远没成熟,大一统在后面
那最后,世界模型最后会不会“大一统”?
我们的判断是:应用形态会继续分化,底层能力则会不断收敛。世界模型更大的未来,藏在 L3 之后。
今天的 L3,还是需要有人告诉机器人要做什么。
它可以在执行中调整动作,但目标和任务边界,大多已经由人提前画好。
到了 L4,人不会再把每一步都说明白。
比如只给一句“把房间收拾好”,模型要自己判断先整理哪里、抽屉打不开怎么办、哪些地方还需要探索。它开始为整个结果负责。
L4 更难的一步,是把反馈变成经验。
执行失败后,它要调整这一次;下次遇到类似情况,还应该少犯一次错。
到了 L5,主角从一台机器人变成了一支队伍。
一个机器人搬运,一个机器人检查,数字智能体同步库存,人类只在高风险环节确认。任务变化时,谁接手、谁等待、资源怎么重新分配,都需要围绕同一个世界状态调整。
如果再续看之前骑车的那个例子,会很有趣:
L3 是学会保持平衡,L4 是自己选路并绕过障碍,L5 则是带着一支骑行车队共同抵达目的地。
会骑车还不够。它还得知道去哪,以及怎么带着别人一起到达。