news 2026/9/2 23:57:24

我仔细看了 Atlas 的技术博客,发现它和市面上的视频生成模型不是一回事

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
我仔细看了 Atlas 的技术博客,发现它和市面上的视频生成模型不是一回事

今天(9 月 2 日)李飞飞的 World Labs 发了 Atlas,官方喊的是"全球首个多模态世界模型"。我看了一圈中文媒体的报道,基本都在说"几张照片生成 1 分钟视频"——这个说法没错,但讲漏了最关键的东西。

我花了点时间把 World Labs 的官方博客翻了一遍,越看越觉得,Atlas 和市面上那些文生视频模型走的不是同一条路。它不是在"生成视频",它是在"理解空间"。

它和视频生成模型的本质区别在哪

先搞清楚一个基本问题:为什么 Atlas 不叫"视频生成模型",而叫"世界模型"?

你把一张照片丢进 Sora 或者 Dreamina,它给你生成一段视频。这段视频看起来可能很流畅,但画面里的物体之间的关系是"猜"出来的——模型没有真正理解这个场景里桌子在哪、椅子离墙多远、光线从哪个方向来。它只是见过足够多的视频,学会了一个像素到另一个像素的过渡模式。

Atlas 不一样。它把输入的照片、视频、文本全部转成"空间上下文"——说人话就是,它给画面里的每个像素都标了一个三维坐标。你告诉它"镜头往左移 30 度",它不是靠猜,而是真的知道左边应该有什么。

这个区别在官方的一个演示里体现得特别明显:他们用三台手机从不同角度拍同一个房间,然后输进 Atlas。模型没有看过这个房间的完整样子,但三台手机的画面在空间上被对齐了——模型理解了"这三段视频拍的是同一个三维空间"。然后它能从任意新视角生成画面,包括从天花板往下看这种任何一台手机都没拍到的角度。

这不是"视频生成",这是"空间重建 + 新视角渲染"。

架构上做了哪些不一样的选择

官方博客里提到了模型架构,但没有给论文、没有开源、没有定价。这个"三没有"也挺有意思的——说明还在早期,先放 demo 出来抢个位置。

不过从透露的信息来看,架构设计有几个值得关注的点:

第一,从零开始预训练,不是在现有模型上改的。现在很多视频模型是从文生图模型扩过来的(比如 Sora 基于 DALL·E 的技术路线),但 Atlas 的预训练数据里同时包含了文本、图像、视频和 3D 数据。World Labs 的说法是,从训练第一天起,这四种模态就共享同一个表示空间。这样做的好处是,跨模态的对齐不是"后期加上的功能",而是模型天生就具备的能力。

第二,空间上下文替代了文本上下文。这个是核心设计思路。LLM 的本质是把所有东西都变成 token 序列,然后做 next token prediction。Atlas 的思路类似,但它的"token"不是文字,而是带空间位置的信息单元。模型要预测的也不是下一个词,而是"在这个三维空间里,下一个合理的内容应该是什么"。

第三,自回归 + 扩散,两个一起用。自回归部分负责生成序列化的结构(比如相机轨迹、动作序列),扩散部分(用的是 rectified flow)负责生成高维连续内容(像素级画面)。这种混合架构不算全新,但在世界模型这个尺度上,Atlas 是第一个把它跑通了的。

为什么说它最大的价值不在"拍视频"

聊到这里你可能想问:那它到底能干嘛?

做特效、拍广告、生成虚拟拍摄素材——这些当然可以,而且效果看起来确实不错。但我觉得 Atlas 真正让人兴奋的地方,是它给机器人训练开了一条新路。

现在做具身智能的人最头疼的问题之一,就是"虚拟训练场不够用"。让机器人在真实环境里反复试错,成本高、速度慢、还容易出事故。在仿真环境里训练,又得先花大量人力去搭 3D 场景。业内有个说法:训练一个能在家居环境里干活的机器人,光搭场景就得花掉项目一半的预算。

Atlas 的输出可以转成 3D 点云或者 Gaussian Splatting,这意味着你给我拍几张客厅的照片,我就能得到一个可交互的 3D 场景——机器人可以直接在这个场景里做仿真训练。英伟达的 Jim Fan 在 Atlas 发布后第一时间转了帖,说这是"Real-to-Sim 的一大步"。他不是在客气。

不过话说回来,有几个问题还没答案

说完了好的,说几个我还没想明白的。

第一个问题:早期访问到底什么时候开放?官方博客说的是"in the coming weeks",但具体几周没说。而且目前没有任何 API 定价或者使用门槛的信息。对于想拿它做二次开发的团队来说,光看 demo 是不够的。

第二个问题:没有论文,技术细节到底有多深?官方博客描述了架构思路,但像训练数据规模、模型参数量、推理效率这些硬指标,一个字都没提。对于技术社区来说,想复现或者跟进,信息还不够。

第三个问题:和 Google DeepMind 的 Genie 3、NVIDIA 的 Cosmos 比,到底有没有代差?这几家都在做世界模型,方向高度重叠。Atlas 目前最大的差异化优势是"从零训练 + 原生多模态",但对手的进度也不慢。这场竞赛刚开了个头。

你觉得世界模型这条路,最终会走向"统一模型"还是"垂直分工"?——也就是一个模型包打天下,还是不同场景用不同的世界模型?欢迎评论区聊聊。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 23:55:54

扫描件批量转双层PDF:原理、流程与参数调优实战

简介:这是一款面向文档数字化与档案管理场景的批量转双层PDF工具,适合需要将大量扫描件、图片型PDF转换为可检索双层PDF的办公人员与资料管理员。工具基于PaddleOCR识别引擎,对中文及手写内容均有不错识别效果,转换后上层保留原始…

作者头像 李华
网站建设 2026/9/2 23:53:27

写论文别依赖通用大模型❌思梦航 AI,本科生学术写作更合适

不少同学写论文都会踩同一个坑:直接拿通用大模型来完成整篇毕业论文。 通用 AI 用来闲聊、写创意文案尚可,但直接产出学位论文,很容易遇到参考文献编造、逻辑空洞、AIGC 痕迹过重,遭遇学校双审不通过的情况😭。 这也是…

作者头像 李华
网站建设 2026/9/2 23:52:14

Blender处理VRM模型全指南:从导入导出到常见问题排查

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 23:51:37

酒吧点餐小程序开发:从需求分析到技术落地实战

酒吧点餐小程序开发:从需求分析到技术落地实战 随着酒吧、小酒馆等线下娱乐场景的数字化需求增长,点餐小程序不再是简单的“菜单电子化”,而是逐步演变为集扫码点餐、桌台管理、互动游戏、会员营销于一体的综合性业务系统。本文将以“酒吧点餐…

作者头像 李华
网站建设 2026/9/2 23:51:30

X、Y电容个人笔记

安规电容(X、Y电容)详解长相:如上图所示作用:滤除电磁干扰、高频异常干扰信号,不是过滤220V交流电信号,如雷电、拔插插头导致的。安规电容分为:X电容、Y电容X电容、Y电容放置位置如下图所示:X、Y电容过滤干…

作者头像 李华