今天(9 月 2 日)李飞飞的 World Labs 发了 Atlas,官方喊的是"全球首个多模态世界模型"。我看了一圈中文媒体的报道,基本都在说"几张照片生成 1 分钟视频"——这个说法没错,但讲漏了最关键的东西。
我花了点时间把 World Labs 的官方博客翻了一遍,越看越觉得,Atlas 和市面上那些文生视频模型走的不是同一条路。它不是在"生成视频",它是在"理解空间"。
它和视频生成模型的本质区别在哪
先搞清楚一个基本问题:为什么 Atlas 不叫"视频生成模型",而叫"世界模型"?
你把一张照片丢进 Sora 或者 Dreamina,它给你生成一段视频。这段视频看起来可能很流畅,但画面里的物体之间的关系是"猜"出来的——模型没有真正理解这个场景里桌子在哪、椅子离墙多远、光线从哪个方向来。它只是见过足够多的视频,学会了一个像素到另一个像素的过渡模式。
Atlas 不一样。它把输入的照片、视频、文本全部转成"空间上下文"——说人话就是,它给画面里的每个像素都标了一个三维坐标。你告诉它"镜头往左移 30 度",它不是靠猜,而是真的知道左边应该有什么。
这个区别在官方的一个演示里体现得特别明显:他们用三台手机从不同角度拍同一个房间,然后输进 Atlas。模型没有看过这个房间的完整样子,但三台手机的画面在空间上被对齐了——模型理解了"这三段视频拍的是同一个三维空间"。然后它能从任意新视角生成画面,包括从天花板往下看这种任何一台手机都没拍到的角度。
这不是"视频生成",这是"空间重建 + 新视角渲染"。
架构上做了哪些不一样的选择
官方博客里提到了模型架构,但没有给论文、没有开源、没有定价。这个"三没有"也挺有意思的——说明还在早期,先放 demo 出来抢个位置。
不过从透露的信息来看,架构设计有几个值得关注的点:
第一,从零开始预训练,不是在现有模型上改的。现在很多视频模型是从文生图模型扩过来的(比如 Sora 基于 DALL·E 的技术路线),但 Atlas 的预训练数据里同时包含了文本、图像、视频和 3D 数据。World Labs 的说法是,从训练第一天起,这四种模态就共享同一个表示空间。这样做的好处是,跨模态的对齐不是"后期加上的功能",而是模型天生就具备的能力。
第二,空间上下文替代了文本上下文。这个是核心设计思路。LLM 的本质是把所有东西都变成 token 序列,然后做 next token prediction。Atlas 的思路类似,但它的"token"不是文字,而是带空间位置的信息单元。模型要预测的也不是下一个词,而是"在这个三维空间里,下一个合理的内容应该是什么"。
第三,自回归 + 扩散,两个一起用。自回归部分负责生成序列化的结构(比如相机轨迹、动作序列),扩散部分(用的是 rectified flow)负责生成高维连续内容(像素级画面)。这种混合架构不算全新,但在世界模型这个尺度上,Atlas 是第一个把它跑通了的。
为什么说它最大的价值不在"拍视频"
聊到这里你可能想问:那它到底能干嘛?
做特效、拍广告、生成虚拟拍摄素材——这些当然可以,而且效果看起来确实不错。但我觉得 Atlas 真正让人兴奋的地方,是它给机器人训练开了一条新路。
现在做具身智能的人最头疼的问题之一,就是"虚拟训练场不够用"。让机器人在真实环境里反复试错,成本高、速度慢、还容易出事故。在仿真环境里训练,又得先花大量人力去搭 3D 场景。业内有个说法:训练一个能在家居环境里干活的机器人,光搭场景就得花掉项目一半的预算。
Atlas 的输出可以转成 3D 点云或者 Gaussian Splatting,这意味着你给我拍几张客厅的照片,我就能得到一个可交互的 3D 场景——机器人可以直接在这个场景里做仿真训练。英伟达的 Jim Fan 在 Atlas 发布后第一时间转了帖,说这是"Real-to-Sim 的一大步"。他不是在客气。
不过话说回来,有几个问题还没答案
说完了好的,说几个我还没想明白的。
第一个问题:早期访问到底什么时候开放?官方博客说的是"in the coming weeks",但具体几周没说。而且目前没有任何 API 定价或者使用门槛的信息。对于想拿它做二次开发的团队来说,光看 demo 是不够的。
第二个问题:没有论文,技术细节到底有多深?官方博客描述了架构思路,但像训练数据规模、模型参数量、推理效率这些硬指标,一个字都没提。对于技术社区来说,想复现或者跟进,信息还不够。
第三个问题:和 Google DeepMind 的 Genie 3、NVIDIA 的 Cosmos 比,到底有没有代差?这几家都在做世界模型,方向高度重叠。Atlas 目前最大的差异化优势是"从零训练 + 原生多模态",但对手的进度也不慢。这场竞赛刚开了个头。
你觉得世界模型这条路,最终会走向"统一模型"还是"垂直分工"?——也就是一个模型包打天下,还是不同场景用不同的世界模型?欢迎评论区聊聊。