前言
过去一年,具身智能领域在模型架构上展开激烈范式之争
- 一派坚守 VLA(视觉-语言-动作模型),认为端到端直接从图像映射到机械臂动作,结构精炼、推理极快,是高频实时闭环控制的唯一可行方案;
- 另一派力推 WAM(世界动作模型),主张机器人不能只会模仿历史轨迹“盲目反应”,而应像人类一样,在动作前先推演物理世界的画面与空间变化
不过,我个人认为啊
- 单纯的VLA或WAM目前在落地方面,目前都还不太行
但VLA结合上RL(即RL微调VLA)相比“单纯的VLA和单纯的WAM”而言,在目前工业场景中的应用落地相对更成熟点- 至于一年没去过几十个工厂的 就不要不懂装懂、或人云亦云了,毕竟更进一步,算法也只是个基础,真正决定落地成败的更关键还是:数据本身的质量 + 一系列工程优化
- 言归正传,虽然在理论上,单纯的世界模型比单纯的VLA更具泛化潜力
但 WAM 一旦落地真实硬件,便撞上工程高墙:推理延迟与计算开销
比如,真实抓取与装配任务需要 10Hz–50Hz 以上的控制频率,而传统 WAM 每预测一帧高分辨率画面需数十步扩散去噪,端侧耗时动辄数百毫秒乃至数秒——机械臂等待“幻想未来”时的卡顿,反而扼杀了实时闭环 - 行业由此陷入两难:
选 VLA,要忍受其在复杂接触任务中的泛化瓶颈
选 WAM,则要为庞大算力买单,甚至被迫训练部署两套模型权重
华盛顿大学与英伟达团队最新推出的 Flex-π 正是为打破这一对立而来。它不争论“谁淘汰谁”,而是务实兼容:让 WAM 兼容 VLA,将范式之争转化为同一模型权重内部的快慢路径选择
顺带说一句,今天是26年十一假期的第一天,解读该篇paper
其实,不论全球具身技术 如何变化快,永远追踪全球最前沿,并花大精力落地到实际生产应用中,是我司「视频号上搜:七月具身July」自24年起,十年不变的宗旨
第一部分 Flex-π: A Multi-Stream World-Action Model with Compute Flexibility
1.1 引言与相关工作
1.1.1 引言
通用型机器人策略中,一类能够联合预测未来观测和动作的模型——世界-动作模型(World-Action Models,WAMs)——近期已被证明是视觉-语言-动作模型(VLAs)的有力替代方案
WAMs 的示教效率和泛化能力主要得益于两个因素:
- 第一,它们在训练过程中通过联合预测动作和未来观测来学习鲁棒的表示(Zhu et al., 2025; Ye et al., 2026b)
- 第二,它们从在大规模视频数据上预训练的视频生成骨干网络中继承了强有力的时空先验(Kim et al., 2026b; Yuan etal., 2026b; NVIDIA et al., 2026)
作者在这两个方面的基础上进一步提升,训练得到的 WAM策略在示教效率和泛化能力上都有显著提高,同时依然保持足够的推理速度以满足部署需求
- 尽管对未来视觉观测的预测是 WAM 训练的核心,但当前通用型 WAM 几乎一律是基于视频生成模型编码器来预测未来的 RGB 图像潜变量(Ye 等,2026a;b;Yuan 等,2026b)
虽然这种方式行之有效,但这些通过像素重建训练得到的潜变量主要捕捉的是外观细节,并没有与机器人操作所需的三维结构或物体语义对齐 - 若能直接监督几何与物体语义,就能同时获取这两类信息,为 WAM 提供更强的联合预测训练信号,但代价高昂:需要额外的传感器模态、训练新的先验,或牺牲推理速度
本文要探讨的是:如何在不付出这些代价的前提下,放大 WAM 的优势——即联合预测能力和强视觉先验?
为了解决这些问题,来自1 University of Washington、2 Allen Institute for AI的研究者提出了FLEX-π,这是一种拥有 60 亿参数的 WAM,通过训练来预测不仅是未来的 RGB 观测,还包括未来的三维点图(3D pointmaps)和物体级语义,因此在示例效率和泛化能力方面都非常出色
- 其paper地址为:Flex-π: A Multi-Stream World-Action Model with Compute Flexibility
- 其项目地址为:flex-pi.github.io
其github地址为:github.com/geyan21/flex-pi
具体而言
- FLEX-π 不会产生前述三种成本中的任何一种。点图和物体语义都从同一张RGB图像中提取——分别通过Depth Anything 3和DINOv3,因此不需要 RGB 之外的任何传感器模态
两种编码器都是即取即用的预训练模型,因此不需要再训练新的视觉先验
————
关于DINO v3,参见本博客中的解读《Meta发布的自监督ViT DINO的发展史:从DINO、DINOv2到通用视觉特征提取器DINOv3》 - 而且,由于在部署时可以丢弃任意视觉模态,同时模型仍能从额外的训练监督中受益,因此不会增加推理延迟
更进一步而言
- FLEX-π 使用来自一个预训练视频生成模型(Wan 等, 2025)的单一冻结 VAE
将 RGB 图像和3D pointmap一并编码到同一潜在空间中——尽管该 VAE 只在 RGB 像素上进行过训练,但它仍能直接重建 pointmap
并结合DINOv3(Siméoni 等, 2026)来构建以目标为中心的 DINO 特征 - FLEX-π 将每一种视觉模态都嵌入到一个共享的 token stream潜在空间中,每种模态对应一条 token 流
随后,它将每条流路由进入一个 Mixture-of-Transformers(Liang 等, 2025)主干网络。由于动作与每个未来视觉流是联合生成的,该策略能够继承互联网规模预训练所带来的丰富先验,并为动作生成学习到更强的内部表征
最后,FLEX-π 在训练过程中随机丢弃部分视觉输入流,并施加跨模态 forcing——无论某个模态是否作为输入被观测到,都要生成其未来流——从而使得单个训练好的 checkpoint 在推理时具备对任意可用视觉输入与输出子集进行操作的灵活性
这使得实践者可以在部署阶段自行选择位于速度–性能折中曲线上的位置,而不是在训练阶段就将其固定(见图 1)——即既可以选择VLA-style(action only)进行部署,也可以选择WAM-style(RGB + 3D + DINO)进行部署
即其同时接收RGB、3D和DINO视觉特征,并联合生成潜在的未来视觉特征和动作。完成训练后,它支持灵活的推理模式,使终端用户能够在时延与性能之间进行权衡
总体而言,FLEX-π 证明了一个WAM 几乎可以“免费”获得语义和几何层面的落地——无需新传感器、无需新的预训练、无需更慢的推理速度——从而在保持足够快速以便部署的同时,带来更优的策略性能
1.1.2 相关工作
首先,对于通用操作策略
- 一个重要的研究方向是在预训练视觉-语言模型之上构建通用操作策略,表明基于网络规模数据学得的先验可以迁移到机器人控制中,相比专用策略获得更强的泛化能力
Brohan 等,2023RT-2;Black 等, 2024π₀;Niu 等, 2024LLARVA;
Intelligence 等, 2025π₀.₅;NVIDIA 等, 2025GR00T N1;Li 等, 2025aHAMSTER;
Goyal 等,2025VLA-0;Team 等,2025Gemini Robotics;Chen 等,2025bTraining Strategies for Efficient Embodied Reasoning;
Lee 等,2025MolmoAct;Yan 等,2025bManiFlow;Fang 等,2026MolmoAct2;
Zha等,2026LAP;Chen 等,2026Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control;Kim 等,2026aRLDX-1 Technical Report;
Wu 等,2026;Barreiros 等,2026;Galaxea Team,2026Galaxea G0.5
在动作微调过程中,它们在不建模未来观测的情况下预测动作,说白了,就是VLA - 第二类研究路线则侧重于预测视觉输入如何随时间变化,具体做法要么是在图像空间中进行规划,要么通过联合的世界–动作目标来对策略进行正则化
早期方法将控制建模为文本条件的视频生成(Du 等,2023),或者先在网页数据上预训练视频生成器,再对其进行下游操作任务的微调(Wu 等,2024;Cheang 等,2024GR-2;Zhou 等,2024bRoboDreamer)
更新的工作则在这一范式上进行扩展和规模化
Jang 等,2025DreamGen;Huang 等,2025bDreamGen;Bi 等,2025Motus;
Gao 等,2026DreamDojo;Yin等,2026PlayWorld;Wang 等,2026;
Guo 等,2026Ctrl-World;Zhang 等,2026
具体而言诸如UWM(Zhu 等,2025Unified World Models)和 DreamZero(Ye 等,2026b)这样的联合世界–动作模型,会同时执行动作和视频生成,相比仅进行动作生成,这种方式可以学习到更优的表征
出于计算效率的考虑,大多数基于世界模型的策略都会在潜在表征空间中进行预测(Zhou 等,2024aDINO-WM;Maes 等,2026LeWorldModel;Hafner 等,2020;2023;Hansen 等,2024TD-MPC2;2026;Zhu 等,2025)
与Flex-π的工作最为接近的是,近期通用型的 WAM 策略通常从预训练的视频生成模型初始化,并采用针对潜在RGB 的预测目标(Ye 等,2026b;aGigaWorld-Policy;Li 等,2026;Zhang 等,2026;Yuan 等,2026bFast-WAM)
然而,与只预测单一 RGB 潜变量序列不同,FLEX-π 会共同去噪 RGB 的潜变量、表示物体语义的DINO 特征以及 3D 点云映射,从而将 WAM 训练监督扩展到几何与语义两方面的关注
其次,对于多模态策略学习
- 越来越多的研究通过引入额外输入来为操作任务提供语义支撑,例如提供显式的3D 输入(Shridhar et al., 2022Perceiver-Actor; Zhu et al., 2023; Shi et al., 2023RoboCook; Goyal et al., 2024RVT-2; Ze et al.,20243D Diffusion Policy; Yan et al., 2025aDNAct; Li et al., 2025b ; Zhen et al., 20243D-VLA; Singh et al., 2025OG-VLA; Qu et al., 2025SpatialVLA; Yanet al., 2025b)
或学习 3D 世界模型(Peri et al., 2024; Huang et al., 2025aParticleFormer; 2026PointWorld; Duisterhof etal., 2026)
相比之下,FLEX-π 直接将 3D 特征投影到与 DINO 和 RGB 特征共享的潜在空间中,具体做法是使用一个预训练视频世界模型的 VAE 编码器,对与对应 RGB 图像具有相同形状的 3D点云映射进行编码。此外,即便在推理阶段没有 3D 输入,FLEX-π 依然可以正常工作 - 其他研究表明,在训练过程中对额外的输入模态进行掩蔽(例如通过扩散噪声处理),可以使策略泛化得更好(Block 等,2023;Hong 等,2026TMRL),
或者在推理阶段灵活变换输入模态(Skand 等,2024;Huang 等,2025c)
而作者通过注意力掩蔽同时去掉视觉输入和输出,并在此条件下训练 FLEX-π 仍然去预测输入中缺失的视觉模态(跨模态强制,见第 3.2 节)
且作者宣称,他们发现,这种做法通过迫使模型从其他模态中内化每一种视觉表征,从而提升了策略性能(图 12)
1.2 FLEX-π:一种计算灵活的多流 WAM
综上,作者将 FLEX-π 具体实现为一种世界—动作模型(world-action model),在 RGB 之外,还通过对未来三维几何和物体语义进行监督进行训练,同时不会产生三类额外代价:额外传感器输入、单独训练的视觉先验,或额外的推理延迟
- 且作者使用来自同一个预训练视频生成模型的单个冻结 VAE,同时对 RGB 图像和 3D 点云图(3D pointmaps)进行编码,并使用一个冻结的DINOv3 编码器提供物体级语义 token;
每种视觉输入模态各自形成一个 token 流,再通过一个Mixture-of-Transformers 主干网络进行融合,该主干由同一视频模型初始化即在时间步 t,RGB 图像 ot和三维点云映射 pt由预训练的 Wan-2.2 VAE 编码为潜在标记序列
,
;DINOv3 生成语义标记
。A流存在掩码 maskₘᵢₙ用于选择在共享的视觉 Transformer 主干网络中被关注的视觉流
一个较小的动作专家(Action Expert)对这些视觉流进行交叉注意,以生成在时间步 t+H 处的动作片段aₜ:ₜ₊ₕ。条件 (sₜ, lₜ) 在各个流之间共享,而输出掩码 mₒᵤₜ则用于设定在与动作联合生成时,哪些未来的视觉流
彼此可见
- 且作者在训练过程中对输入和输出同时进行掩蔽,从而得到一个单一的 checkpoint,可在推理时支持任意组合的输入和输出流
1.2.0 问题表述与背景知识
首先,作者的目标是训练一种策略,使其在给定图像观测、本体感知状态
和语言指令
的条件下预测动作
- 此外,作者假设可以访问
来自 DINO-v3(Siméoni 等,2026)编码器的 DINO 特征
以及
以点图(pointmaps)形式表示的 3D 信息(由 Depth Anything 3(Lin 等,2026)应用于
获得)
- 然后训练一个灵活的世界动作模型(World Action Model,WAM)
该模型也可以生成任意子集的未来视觉输入模态,并且在最小情况下只需接收单一视觉输入,例如
注意,对应于一个动作块
(输出观测同理),但为提高可读性,在本文的大部分内容中省略块的记号
其次,对于用于视频生成模型的流匹配(Flow Matching)
- 作者考虑到当前最先进的视频生成模型(HaCo-hen 等,2024;Kong 等,2024;Wan 等,2025;NVIDIA,2025;NVIDIA 等,2026)
通常利用一个图像编码器 Enc 和解码器 Dec(例如,一组作为变分自编码器(VAE)(Kingma &Welling, 2013)的一部分训练的 U-Net(Ronneberger 等, 2015))
将图像编码到潜在空间
,预测未来的潜在图像
然后将其解码回重建图像 - 对真实下一时刻潜在表示的预测,是通过一个基于 flow matching(Lipman et al.,2023; Liu et al., 2023b) 的扩散 Transformer(Peebles & Xie, 2022)模型
来完成的
——
ps,关于扩散transformer,可以参见本博客中的解读《Diffusion Transformer(DiT)——将扩散过程中的U-Net换成ViT:近频繁用于视频生成与机器人动作预测(含清华Prediction with Action详解)》
该模型基于线性路径进行训练, 其中ϵ ∼ N(0, I),流动时间步
对于的本质就是:把真实未来 latent 和随机噪声按比例混合,构造训练样本
其中 τ 控制“离真实答案有多近”:τ=0 是纯噪声,τ=1 是真实 latent
模型看到中间状态,学习从噪声指向真实 latent 的方向
「毕竟向量的方向=终点向量干净画面
-起点向量噪声
」;推理时就沿这个方向,从噪声一步步生成未来
————
ps,如果还不太理解,则详见本博客中此文《π0——用于通用机器人控制的VLA模型:一套框架控制7种机械臂(基于PaliGemma和流匹配的3B模型)》的“1.2.2 流匹配(含对流匹配及速度向量公式的详解)”一节
故对流动路径的恒定速度进行回归(定义为公式1)
在推理阶段,是通过在
到
区间内,对
进行 K 次 Euler 积分生成的,随后经由Dec 解码。关键在于,(Enc, Dec) 为任意图像形状的张量定义了一个潜空间;作者将其同时用于图像
和点图
。需要注意的是,从 π 采样对应于沿着流体常微分方程(flow ODE)在激活的输出通道上对
进行积分
1.2.1 输入视觉流与模型骨干网络
FLEX-π 在三种互为补充的视觉token流上运行,每一种分别提供视觉、空间或物体级语义信息
- RGB 图像
和 3D 点图
分别增加外观上下文和显式空间几何信息
两者都由同一个、来自预训练视频生成模型的冻结 VAE 编码,因此这两路流都可直接继承大规模视频预训练得到的时空先验 - DINO 特征
由冻结的DINOv3(Siméoni 等人,2026)编码器计算,用于以物体语义来辅助锚定其他特征
第一,对于视觉输入编码
作者使用了Wan-2.2-5B视频生成模型中VAE的冻结编码器和解码器。出乎意料的是
- 作者发现,直接使用这个仅在图像上训练的、已冻结的 VAE 对点图进行编码再解码,就能得到非常精确的重建结果,使其潜在空间在编码三维信息的同时保持——场景结构(图 3)
啥意思呢,为方便大家更好的理解,我再补充说明一下
简单说:作者把 3D pointmap 当成一张“特殊的图片”来处理
Pointmap 每个像素存的不是 RGB 颜色,而是三维坐标 (x,y,z) 。作者发现,即使 Wan-2.2 的 VAE 原本是为图像训练的,直接用它压缩和还原 pointmap,效果也非常好
所以好处是:不用再训练一个专门的 3D 编码器,RGB 和 3D pointmap 可以共用同一个 VAE latent 空间,同时还能保留场景的三维结构。图中 Reconstruction 和 GT Pointmap 很接近,就是在证明这一点 - 对于 DINO,作者保留所有 patch token,并将每个 2×2 的 patch 邻域无损折叠成单个 token(768→3072 维度,可参见 PixelUnshuffle(Shi 等人,2016)),在不丢弃空间细节的前提下,将模型生成的 token 数量减少到原来的 1/4(详见附录 A.3 节)
第二,对于全局条件
文本指令由来自Wan-2.2的冻结umT5编码器(Chung等,2023)处理,并与(编码细节见A.1节)结合,作为潜在预测模型
的全局条件向量(如图2所示)
FLEX-π的输入为
第三,模型骨干
- 给定上面公式 (2) 中的输入,作者训练一个潜变量 DiT 模型
,该模型同时预测未来动作以及RGB、pointmap和DINO潜在 token
联合预测未来图像已被证明可以提升动作预测性能(Zhu et al., 2025; Ye et al.,2026b; Dyna Robotics, 2026);在作者的实验中,作者宣称,他们同样证明,这一结论同时适用于pointmap 和 DINO 特征
且为在融合所有输入与输出模态的同时减少训练与推理时间,作者采用 mixture-of-transformers(MoT)(Liang et al., 2025)模型,用同一个Transformer 主干网络(50 亿参数,直接从预训练的 Wan-2.2-5B 初始化)处理
所有视觉模态 token
、
、
,并为每种模态配备独立的前馈投影网络;
同时,为动作生成部分单独设置键、查询、值、前馈以及归一化参数(约 10 亿参数;作者减小了隐藏维度)
- 跨流注意力仅应用在 30 个 MoT 模块中的中间 16 层,因此早期编码和后期解码保持流特定(stream-specific),而跨模态融合发生在中间主干部分
所有输出、
、
、
最终都通过流特定的前馈预测头进行解码,并使用流匹配损失(公式 (1))进行训练
由于动作expert 比主干更窄,作者按照重采样(resampling)而非直接拷贝的方式,从 Wan-2.2 进行初始化(Yuan et al., 2026b);附录 A.3 详细介绍了这一过程以及将各模态映射入共享主干并从中映射出的每流 adapter
第四,对于因果联合生成
所有输出、
、
和
都是联合生成的:动作 token 会关注当前观测 token
、
、
,并交叉关注所有处于激活状态的视觉输出 token,因此动作生成可以利用模型中不断演化的未来表示。注意力是单向的——任何视觉 token 都不会关注动作流——完整注意力规则见附录 A.5
1.2.2 通过视觉流 Dropout 和跨模态 Forcing 的灵活训练
单个 FLEX-π 检查点在推理阶段无需重新训练,就能够支持任意可用输入与输出流的组合——从仅生成动作到进行完整的联合生成,即使只有 1 路视觉输入也可以实现。作者通过视觉流 dropout 和跨模态forcing 来实现这一点,具体细节如下所述
首先,对于视觉流 Dropout
作者在三个潜在视觉流——RGB、DINO
和Pointmap
——上,为每个样本构造两个相互独立的二值掩码:
- 输入存在掩码
用于选择在时刻
提供哪些视觉流作为条件;
- 输出注意力掩码
(见图 2)用于控制未来 token 之间的联合生成注意力,包括动作 token 交叉关注哪些视觉输出,以及未来视觉 token 之间如何相互关注
每个视觉输入都会以 0.5 的概率被独立丢弃,但至少会保留一个视觉流作为观测(见附录 A.5)
- 关键在于,
并不是损失掩码:它只决定动作 token 读取哪些未来流,而每个未来流始终都会被去噪,并计入相应的 Flow Matching 损失(式 3)
- 这些未来流既会相互关注,也会关注时刻
已观测到的流,因此动作是基于一个联合生成的未来,而不是三个彼此独立的未来进行条件化的
其次,对于跨模态强制(Cross-Modality Forcing)
由于两个掩码是独立采样的
- 从输入中被丢弃的某一条流在输出端仍然要被去噪;模型必须仅根据其余流来合成该模态在未来时刻的内容
作者将这一机制称为跨模态强制,并将其应用于三个视觉流,因此训练将涵盖在时刻观测到的
的任意非空子集到在
时刻生成的任意子集之间的所有映射:
例如,在没有 3D 输入的情况下,仅由 RGB 和 DINO 想象未来的点云图(pointmaps),由 RGB 和几何信息预测未来的 DINO 语义,等等(见图 4)
即如上图所示,单一检查点,兼容任意视觉输入与输出。每一行表示一种示例训练方案,由采样得到的m_in(决定在时间 t 观测哪些流)、以及 m_out(决定在联合预测时哪些视觉输出是可见的)共同确定标示的是一个跨模态强制(cross-modality forcing)的示例,其中 pointmap 输入不被关注(不被注意到),但其他输出的联合生成仍然以生成的 pointmap 未来为条件,从而鼓励 FLEX-π 内化 3D表征
- 这一约束让人联想到掩码语言模型(Devlin 等,2019;Reimers & Gurevych,2019)或掩码视觉自编码器(He 等,2022),它迫使 FLEX-π 内化 3D、RGB 以及以物体为中心的表征,从而有助于策略学习:作者在原论文第 4.5 节中有展示,移除这一机制会导致性能下降
1.2.3 训练目标、数据与推理
在架构(第 3.1 节)和 dropout 方案(第 3.2 节)确定之后,训练和推理都可归结为:在给定样本中处于激活状态的任意流上执行 flow matching
首先,对于损失
- 由于每一个未来流都在不考虑输出掩码
的情况下被去噪,训练目标会对动作流和所有三个视觉流的、由公式 (1)
给出的逐流(flow-matching)损失求和:
其中、
是逐流的损失权重,在作者报告的所有实验中都设为 1。输出掩码
只是注意力掩码,而不是损失掩码——每个流的 head 仍然按照公式 (3) 进行训练
- 对于 DINO,作者使用“x-prediction”(Salimans & Ho, 2022):head 预测的是干净特征
而不是速度,因为第 3.1 节中的 DINO 折叠操作会将每个 token 的特征维度提升到 3072,在该维度下进行速度预测性能会退化(Li& He, 2025)(附录 A.4 节)
其次,对于预训练与微调
- 作者在约 500 小时、来自 AG-IBOT World-Beta(AgiBot-World-Contributors 等,2025)中 100 个任务的数据上对 FLEX-π 进行预训练
- 该数据集是一个大规模双臂操作数据集,以30Hz 采样率,从一个头戴摄像头和两个手腕摄像头记录
Pointmap 通过使用 Depth Anything3(Lin 等,2026)对这三个视角全部进行标注获得
更多预训练细节见附录 B。预训练完成后,我们在每个实验域上进行特定领域的微调
最后,对于推理
给定选定的输入/输出模式,FLEX-π 在激活的输出流上对流匹配常微分方程(flow-matchingODE)运行 K 步 Euler 积分,并输出长度为 H 的动作块(见附录 A.2)
原论文第 4.5 节评估了这些不同选择各自的成本与收益;附录 I 描述了用于测量报告延迟的、无需额外训练的部署栈,而附录 A 提供了更多架构细节
// 待更