news 2026/10/1 18:08:42

世界模型的定义虽然很乱,但闭环正在收拢。

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
世界模型的定义虽然很乱,但闭环正在收拢。

一个机器人伸手去拿桌边的杯子。

半秒前,它看到杯子还在桌沿。半秒后,有人把杯子往里推了几厘米。如果它只是记住了上一帧画面,动作会非常准确地伸向一个已经不存在的位置;如果它能理解“我这一伸手之后,世界会怎样变化”,它才有机会停下来、重算路径,甚至换一种抓取方式。

对视频生成模型来说,这只是画面连续性问题。对机器人来说,这是一次会不会失败的行动。

世界模型真正的分野,就藏在这半秒里:它到底是在生成一个看起来合理的世界,还是在为一次动作之后的世界承担预测责任?

原文链接:世界模型的定义虽然很乱,但闭环正在收拢。

01 我们听到的世界模型可能压根不是一类。

今年 6 月,李飞飞教授与 World Labs 团队发布《A Functional Taxonomy of World Models》,试图给越来越拥挤的“世界模型”概念画一张地图。

从经典的 POMDP 框架出发,按系统“输出什么”把世界模型分成三类:输出像素的渲染器、输出几何与物理状态的模拟器,以及输出动作的规划器。

两个月后,来自清华大学的研究学者发布了技术报告《General World Models from First-Principles》。

这篇工作不再从现有产品出发做归类,而是从第一性原理追问:一个世界模型要走向“通用”,内部究竟需要具备哪些能力?

前一篇按模型的输出功能整理现状,后一篇沿着理解、预测、行动与反馈推演路线。两篇工作一前一后,刚好把今天世界模型的分歧展开了。

这背后也暴露了一个行业越来越难回避的问题:今天大家说的“世界模型”,可能压根不是同一种东西。

视频生成、3D、自动驾驶和机器人团队都在用世界模型。

成果物可以是一段逼真的视频、一座能实时探索的数字空间、一套机器人训练环境,也可以是智能体脑中用于预测与规划的内部模型。

看上去都在“构建世界”,但解决的问题,却相差很远。

视频生成模型学习的是像素随时间变化的规律。它要保持人物、场景和运动连续,让一段从未发生过的视频看起来足够合理。

交互式世界生成模型再往前走一步。用户可以改变视角、移动角色或持续输入指令,模型据此生成后续环境。这里的关键,从一次性生成变成了状态能否持续、输入能否即时改变未来。

机器人领域的世界模型又是另一套要求。

它不只需要预测“下一帧长什么样”,还要预测夹爪向左移动两厘米、手腕旋转一个角度之后,物体会不会滑落、碰撞或偏离目标。预测最终要落到动作上,还要接受真实世界的检验。

三者之间并非泾渭分明:好的规划需要模拟行动后果,好的模拟也常常需要被渲染成人类或机器可读的观测。

那究竟应该怎么分类?好像之前一直没有标准。

02 混乱是因为行业初期,还是根本没有标准?

说到这,世界模型早就过了“因为太早,所以说不清”的阶段。

从自驾到大模型时代,再到现在具身,世界模型的声音根本就没断过。

今天真正缺的,是一套能够衡量视频生成、交互环境和机器人行动的共同能力坐标。

只是具身让这件事变得紧迫罢了。

近日,生数科技在《General World Models from First-Principles》中给出 L1—L5 五级路线:从生成世界、与世界交互、在世界中行动,一直走向自主世界智能体和世界组织者。

这套分级还不算行业标准,但它提供了一把有用的尺子——每升一级,模型都要把更多能力接进反馈回路。

看着这个表,L1 到 L3 的差别,我觉得用学习骑自行车这件事儿,可以讲得更明白。也对应我们常看到的几类世界模型。

所谓L1,就是让模型先坐在路边看,理解骑车这件事应该是怎么样的?如何上车、怎么样会摔倒?解释的是骑车这件事通常怎样展开?

如果中间有人突然插入你骑行的轨迹 or 有人喊你应该换种骑法,L2可以根据新输入改变后续画面。世界由此从一次性结果,变成一个会回应的过程。

真正的门槛出现在 L3。

看过再多骑车视频,也不等于掌握平衡。只有坐上车,转一次车把、踩一下刹车,身体与道路才会共同改写下一秒;一旦失衡,还要根据新的反馈把车救回来。

到了这一层,模型的动作进入世界,世界的变化又反过来修正动作。

他们的Vidu Q3就是L1级别,Vidu S1 对应L2,Motubrain就是WAM(L3)level。

不过即使到L3,也只是让闭环有了一个可以观察的雏形,却没有回答规模化问题。

而WM想要在真实世界中转起来,绕不开三个核心问题。

1)世界知识怎样继续扩大?

2)不同模态与动作如何共享状态?

3)机器人不能等,需要实时反馈。

03 世界模型的闭环必须满足三个条件。

谈到闭环,后面的事情就比较工程了。

甚至这个工程纵深很大。

会做一次动作,只是起点。

本体换了、任务拉长、环境持续变化,单次成功很快就会失去意义。

世界模型的 scaling,必须同时发生在三个维度:知识覆盖继续扩大,视觉、语言和动作共享一个持续更新的状态,推理速度还要追上物理世界。

1)缺了底座,动作策略长不大;缺了塔尖,再丰富的想象也落不了地

世界模型(比如WAM这类结构)最先遇到的,是一笔很难算的数据账。

互联网上有近乎无限的视频。它们能告诉模型杯子会摔、液体会洒、人通常怎样完成一项任务,却很少记录“末端移动了多少、夹爪何时闭合”这些动作信息。

真机轨迹正好补上这一块。每一步动作和反馈都很清楚,可采集昂贵、规模有限,还常常与具体本体绑定。

一端有规模,一端有动作。

世界模型要把两者接进同一个闭环,需要一条从“看懂世界”逐步走向“用身体介入世界”的数据路径。

所以,训练世界动作模型不能陷入“视频还是机器人数据”的二选一。

这个data recipe很重要!

《General World Models from First-Principles》中提出的 D1—D5 数据金字塔,就是对这个问题的回答。

金字塔底部,D1 的互联网视频和 D2 的教学视频负责打开世界的广度:物体如何运动,任务通常怎样展开,人类又如何完成一件事。

到了 D3,视角从旁观者转向行动者。第一视角人类视频让模型开始从“我要怎么做”的位置观察环境。D4 再加入带动作记录的人类示范,把“做了什么”与“世界发生了什么变化”连接起来。

塔尖的 D5,才轮到真实机器人轨迹。它负责最后一步校准:这副机械臂能伸到哪里,夹爪怎样发力,已有的世界知识如何变成这具身体真正能执行的动作。

越往上,数据越少、越贵,动作与反馈却越来越密。金字塔的价值,就在于让不同数据各司其职。

视频教会模型世界通常怎样变化,真实交互教会模型这具身体能够怎样改变世界。

这也意味着,没有动作标注的视频依然有价值。逆动力学可以从前后状态变化中反推动作线索,潜空间预测与生成式建模可以学习动态规律。

有限的真机数据,则负责把这些规律对齐到具体本体。

我们了解到,Motubrain 还使用相对末端执行器动作表征,试图减少不同机械臂在关节空间上的差异。

按照他们之前披露的数据,模型可以利用50—100条目标机器人轨迹完成适配。

2)各类任务需要共享一个“不断更新的世界”

有了数据,下一道问题是怎么把它们接起来。

谁来保证视觉、语言和动作看到的是同一个世界?

机器人执行长程任务,最怕各个模块活在不同的“现在”里。

视觉刚刚看到杯子在桌边,语言模块记住的目标是“把杯子递给人”,规划模块也已经生成路径。可就在机器人伸手之前,杯子被人挪走了。如果动作模块仍沿用几秒前的状态,它会非常准确地走向一个错误的位置。

每个模块单独都对,机器人合起来却做错了。

模块化系统边界清晰、容易调试,至今仍有很强的工程价值。问题出现在任务变长、环境持续变化之后:感知、规划和控制之间传递的是一张张快照,而快照随时可能过期。

Mixture-of-Transformers(MoT),处理的正是这个问题。

让不同模态保留各自适配的参数结构,同时通过共享注意力交换上下文。视觉、语言和动作不再依靠层层转述,而是站在同一张白板前,看见同一个目标与环境变化。

于是,长程任务不再是一条写死的动作序列。

夹取落空,模型更新“物体仍在原位”;花瓶被挪动,目标位置随之改变。下一步动作从最新状态继续计算。

所以,闭环能否持续,关键就在于所有模块始终活在同一个“现在”。

3)实时反馈和大规模算力必不可少。

数据决定模型懂多少,架构保证几种能力活在同一个“现在”。

可到了机器人的端侧,还要再加一条:

这个“现在”,不能在推理结束前变成过去。

世界模型的 scaling 有一组天然矛盾。训练端希望模型更大、数据更多、理解更完整;机器人端却要求它在更短时间内完成观测、预测和动作更新。

离线生成一段视频,多等几秒通常没有影响。但在物理世界里,杯子可能正在滑动,目标也可能突然被人挪走。半秒前完全正确的判断,到了下一秒就可能变成错误动作。

因此,算力决定的不只是模型能学到多少,也决定闭环能不能及时转起来。

速度之外,动作还要保持连续。动作模型通常一次生成一段动作:等旧动作全部执行完再计算,机器人会停顿;中途直接切换,新旧动作又容易发生跳变。

之前我们分享过的生数那篇paper:《World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment》,其中讲到的Real-Time Chunking(RTC)正是在处理这段交接过程。

它让系统在机器人执行动作时,根据新观测滚动更新尚未完成的部分,同时处理新旧动作块的衔接。

机器人因此可以边行动、边观察、边调整。

数据扩大模型见过的世界,架构维持一个持续更新的世界,算力则让模型始终跟得上这个世界。

4)Motus2,则是整个闭环跑起来的 case

生数最新的 Motus2则提供了一个很值得观察的样本,朱军老师之前也分享过,可以理解为L3级别的进一步验证。

他们把这个工作定义为,用于灵巧操作的自演化通用世界模型:通过模型扩展和数据扩展不断改进。

而且是首次实现闭环自进化迭代,这一点就很接近L4。

同一模型既是策略(WAM)又是模拟器(AC-WM)还是评估器。

前面的条件,到了 Motus2 这里被落实了。

Motus2结构一览

模型上,用一套共享参数统一策略、模拟与评估,形成从动作提议、后果预测、结果判断到策略更新的闭环。

训练上,使用了约 13万小时第一人称人类数据, 涵盖单目、双目等多层次Ego数据。

还有一个需要注意的是,motus2对外表述的是常规数据用于训练WAM,次优和失败数据用于扩展。

闭环的价值这里就彰显了,我们不止一次说过失败数据的价值可能远超我们当下的应用。

此外,这次还加入了灵巧手。

部署了22/20高自由度触觉灵巧手(用的Sharpa、WUJI2),可实现类人的精细灵巧操作。通过机器人域的适配,并利用触觉反馈修正接触过程中的动作。

看了一下论文,报告的两项真机任务中,MBRL 与 Best-of-N Planning 将平均成功率从65%提高至75%。实验范围仍然有限,但已经验证了闭环对策略改进的作用。

不过,口径上,Motus2 可能仍处于 L3,但仍然是生数这家公司往L4迈出的很重要一步。

04 WM还远没成熟,大一统在后面

那最后,世界模型最后会不会“大一统”?

我们的判断是:应用形态会继续分化,底层能力则会不断收敛。世界模型更大的未来,藏在 L3 之后。

今天的 L3,还是需要有人告诉机器人要做什么。

它可以在执行中调整动作,但目标和任务边界,大多已经由人提前画好。

到了 L4,人不会再把每一步都说明白。

比如只给一句“把房间收拾好”,模型要自己判断先整理哪里、抽屉打不开怎么办、哪些地方还需要探索。它开始为整个结果负责。

L4 更难的一步,是把反馈变成经验。

执行失败后,它要调整这一次;下次遇到类似情况,还应该少犯一次错。

到了 L5,主角从一台机器人变成了一支队伍。

一个机器人搬运,一个机器人检查,数字智能体同步库存,人类只在高风险环节确认。任务变化时,谁接手、谁等待、资源怎么重新分配,都需要围绕同一个世界状态调整。

如果再续看之前骑车的那个例子,会很有趣:

L3 是学会保持平衡,L4 是自己选路并绕过障碍,L5 则是带着一支骑行车队共同抵达目的地。

会骑车还不够。它还得知道去哪,以及怎么带着别人一起到达。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 18:07:50

Axure高保真Web组件库搭建实战:从高频组件到前端交付

做了多年Axure高保真原型,我最大的一个感受是:Web开发日常用到的组件,翻来覆去其实就那几十个——导航、按钮、表单、弹窗、表格、分页、下拉菜单。真正的差距不在会不会炫技动画,而是手上有没有一套能反复调用的高保真组件库。这…

作者头像 李华
网站建设 2026/10/1 18:07:49

Python文本分类实战:从txt清洗到TF-IDF与六模型对比

简介:基于Python实现的文本分类系统源码包,适合计算机相关专业学生、机器学习初学者以及需要完成课程设计、毕业设计或算法对比实验的开发者。项目完整演示了从文本预处理、TFIDF特征提取到多模型训练评估的闭环流程,内置KNN、朴素贝叶斯、支…

作者头像 李华
网站建设 2026/10/1 18:07:23

MariaDB容器化部署实战:从Docker Compose到备份恢复全指南

最近好几个朋友问我同一个问题:MariaDB 到底怎么部署才省心?我手里同时管着几套业务库,既有早期在物理服务器上硬装的二进制实例,也有后来全部迁移到容器里的集群,用下来的感受很直接——容器化部署 MariaDB 是当前个人…

作者头像 李华
网站建设 2026/10/1 18:06:42

MySQL数据库入门全攻略:从安装部署到实战避坑

拿MySQL入门数据库,是很多开发者和运维同学绕不开的第一步。这篇文章我不打算按教科书方式讲理论,而是直接以“先装起来、跑起来、用起来”为主线,从头梳理MySQL是什么、能做什么、适合谁,以及在实际部署和日常操作中会被反复踩到…

作者头像 李华
网站建设 2026/10/1 18:06:31

鸿蒙多设备适配:Flutter Flex控件响应式布局实战与避坑指南

去年把一款电商App从安卓侧迁移到鸿蒙,第一轮UI走查就翻车了:同样的布局代码,安卓上看着没问题,到了鸿蒙的小折叠屏和横屏车机上,顶部榜单和底部操作栏直接挤成一片。排查到最后,问题几乎全部集中在Flex控件…

作者头像 李华
网站建设 2026/10/1 18:05:40

子类对父类的方法重写:概念、规则与实战避坑

子类对父类的方法重写:概念、规则与实战避坑不管你是准备课程设计答辩、应付期末考试,还是刚入行写业务代码,方法重写(Override)都是面向对象绕不过去的坎。我见过太多答辩现场,学生能把“重写是对父类方法的重新实现”…

作者头像 李华