news 2026/10/4 21:07:41

JEPA 世界模型如何做好长程任务?Dual-WM 的双潜空间、LoRe 与规划实现

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
JEPA 世界模型如何做好长程任务?Dual-WM 的双潜空间、LoRe 与规划实现

短程任务成功率还不错,目标一旦变远,规划却明显变难。这是世界模型与视觉规划中一个值得追问的现象:单步预测准,长程规划就一定稳吗?

对于依靠潜空间预测和目标距离进行规划的这类 JEPA 世界模型,状态表征既要预测动作后果,也要比较候选未来的任务进展。局部预测准确,并不自动保证递归预测一致,或远处的目标距离仍然有区分度。

Dual-WM 为局部执行和长程规划学习不同的 latent space 和各自的动力学,再通过低层状态窗口连接两层。本文按照问题、设计、训练、规划的顺序展开,最后给出公开实现的阅读与评价入口。

  • 论文:Beyond a single latent space: a dual-latent world model for long-horizon planning
  • 训练与规划核心实现

1. 长程规划的两个卡点:想偏了,或者分不清

想偏了:递归预测漂移。规划中,上一步预测成为下一步的输入。局部训练时不大的误差,经过多次递归可能累积和放大,使想象轨迹偏离真实未来。

分不清:高维距离集中。即使候选未来预测准确,规划器仍需要区分哪些候选更有任务进展。当目标代价过于接近时,搜索缺少清晰的排序信号。

在基于潜空间距离的目标规划中,候选动作先通过动力学得到预测状态,再由预测状态到目标的距离评价。这个距离承担了比较任务进展的作用。

在高维、各向同性正则化的状态表征中,时间相关性减弱后,距离可能趋近维度相关的基准。不同候选未来的目标代价变得相近,就会削弱动作搜索所依赖的排序信号。

论文以零均值、单位协方差状态给出参考关系:

ρ h = 1 d E [ z t ⊤ z t + h ] , E ∥ z t − z t + h ∥ 2 2 = 2 d ( 1 − ρ h ) . \rho_h=\frac{1}{d}\mathbb E[z_t^\top z_{t+h}],\qquad \mathbb E\|z_t-z_{t+h}\|_2^2=2d(1-\rho_h).ρh​=d1​E[zt⊤​zt+h​],E∥zt​−zt+h​∥22​=2d(1−ρh​).

当 ρ_h 接近零,平均平方距离接近 2d;独立标准高斯参考下的距离还具有随维度增加而减小的相对波动。这个分析促使我们单独检验:潜空间的目标距离是否仍能反映长程任务进展。

长程规划需要预测一致性,也需要有区分度的目标距离。

2. 缩短预测链之后,为什么还需要两个潜空间?

平坦世界模型可以改进预测与搜索;层次世界模型可以通过时间抽象缩短长程路线搜索的递归深度。但在仍然共享 latent space 的方案中,局部执行和远期目标评价继续依赖同一套状态几何。缩短预测链,本身不会改变这套几何;距离已经趋于饱和时,远处的候选仍可能难以比较。

局部执行与长程规划对表征提出不同要求。低层要区分影响即时动作效果的状态变化;高层要在较大时间跨度上比较任务进展。

Dual-WM 分开学习两套状态表征与动力学:

时间角色状态构造动力学输入规划作用
低层局部执行z_L = E_L(o)原始动作输入精细动作转移、最终目标匹配
高层长程规划z_H = E_H(W_L)学习得到的宏动作较长跨度预测、隐空间子目标评价

两层共享视觉骨干。高层通过 E_H 将低层状态窗口映射到另一个状态空间,并在宏步动力学目标下训练;分工发生在状态表征和动力学层面。

因此,时间抽象、状态几何和动作接口一起设计:高层步覆盖多个低层步,同时使用适合该时间角色的状态表征来评价目标。

3. 窗口接口:高层状态具体从哪里来?

W_L 是长度 k 的低层 latent window,高层编码为:

z t H = E H ( W t L ) . z_t^H=E_H(W_t^L).ztH​=EH​(WtL​).

单帧初始化时重复当前低层 latent 填满窗口。训练中,高层分支接收停止梯度的低层窗口;高层损失更新高层模块,低层保留自己的预测目标。

一个高层转移覆盖 k 个低层模型步,即 kf 个环境步。训练 rollout 长度 N/M 与规划 horizon H_L/H_H 分别设置,goal offset 则表示数据轨迹中起点与目标的环境步间隔。

4. LoRe:在两种时间尺度上训练自生成预测

LoRe 在编码起点之后持续递归:下一步预测成为后续输入,真实未来观测提供监督目标。低层和高层分别设置预测长度与指数衰减权重。

L L o R e s = ∑ h = 1 n s w h s ∥ z ^ h s − z h s ∥ 2 2 , w h s = exp ⁡ ( − α s h ) ∑ j = 1 n s exp ⁡ ( − α s j ) . \mathcal L_{\mathrm{LoRe}}^s=\sum_{h=1}^{n_s}w_h^s\|\hat z_h^s-z_h^s\|_2^2, \qquad w_h^s=\frac{\exp(-\alpha_s h)}{\sum_{j=1}^{n_s}\exp(-\alpha_s j)}.LLoRes​=h=1∑ns​​whs​∥z^hs​−zhs​∥22​,whs​=∑j=1ns​​exp(−αs​j)exp(−αs​h)​.

分别设置 α_L、α_H,是因为两层的一个预测步代表不同的实际时间跨度,误差传播也可以不同。有限衰减保留每个已纳入 horizon 的监督,同时调节远期误差的训练权重。

指数权重的动机来自递归误差传播分析。在固定动作序列、共享编码起点、预测器具有 Lipschitz 常数L s L_sLs​且单步残差有界的条件下,误差满足e h s ≤ ϵ s ∑ j = 0 h − 1 L s j e_h^s\leq\epsilon_s\sum_{j=0}^{h-1}L_s^jehs​≤ϵs​∑j=0h−1​Lsj​。用于平衡加权平方误差上界的参考权重,在L s > 1 L_s>1Ls​>1的长跨度情形下趋于几何衰减,这启发了 LoRe 的指数权重。

训练保留所有纳入跨度的监督,同时调节被放大的远期误差的影响。α s = 0 \alpha_s=0αs​=0时恢复均匀权重;低层与高层的衰减率分别设置。

下面是损失汇总的简化示意;predictions应由自生成的递归链产生:

importtorchdeflore_loss(predictions,targets,alpha):errors=torch.stack([(pred-target).square().mean()forpred,targetinzip(predictions,targets)])h=torch.arange(1,len(errors)+1,device=errors.device,dtype=errors.dtype,)weights=torch.softmax(-alpha*h,dim=0)return(weights*errors).sum()

公开代码的scripts/train/dual_wm.py中,weighted_mean汇总逐步误差,dual_wm_dynamics_forward连接两层 rollout 与训练损失。论文从 1 编号、代码从 0 编号,在归一化指数权重下等价。

5. MAPS:把宏动作表征接到采样搜索

MAPS 对记录动作窗口的宏动作后验施加朝向标准高斯的 KL 正则:

L M A P S = E A ∼ D D K L ( q ϕ ( u ∣ A ) ∥ N ( 0 , I ) ) . \mathcal L_{\mathrm{MAPS}} =\mathbb E_{A\sim\mathcal D}D_{\mathrm{KL}}\big(q_\phi(u\mid A)\|\mathcal N(0,I)\big).LMAPS​=EA∼D​DKL​(qϕ​(u∣A)∥N(0,I)).

宏动作预测目标保留动作片段效果的信息,先验约束为规划候选生成提供共同的采样基础。规划时,未来宏动作是优化变量。随机编码的 β=0 配置保留随机后验;确定性编码是另一项条件。

6. 三阶段规划:动力学在低层,子目标比较在高层

  1. 高层路线搜索:CEM 优化宏动作序列,高层动力学生成隐空间子目标。
  2. 低层动作细化:P_L 预测候选动作的状态窗口,再用 E_H 映射,与高层子目标比较。
  3. 低层直接收敛:完成设定的高层引导细化轮数后,切换到直接低层目标代价。

阶段二的核心接口是:

cost ⁡ ( A ) = ∥ E H ( W ^ t L ( A ) ) − z ~ j H ∥ 2 2 . \operatorname{cost}(A)=\|E_H(\widehat W_t^L(A))-\tilde z_j^H\|_2^2.cost(A)=∥EH​(WtL​(A))−z~jH​∥22​.

其中,候选 A 在低层动力学中预测,评价使用高层几何。这个接口连接了不同 latent space 中的路线指导与动作执行,最后又用低层距离保留精细完成目标所需的状态差异。

7. 方法证据应该怎样读?

论文使用真实观测的距离与目标排序诊断、自生成预测的物理状态探针,以及窗口接口、LoRe、MAPS 的受控研究,分别检验状态几何、预测一致性和规划行为。

Window-Concat 接口对照与 Dual-WM 接收同一低层窗口,保留同一低层 checkpoint 和粗到细规划器,用于检验学习高层表征的作用。目标排序与成功率提供互补证据,不能只凭排序指标推断全部因果机制。

主结果覆盖 TwoRoom、Reacher、PushT、Cube-Single 与 Sokoban-Long。Sokoban 推箱子任务检验了离散动作空间:低层使用类别型 CEM 搜索离散动作,高层仍在连续宏动作空间规划较长跨度的效果。

目标间隔 100 环境步时,Dual-WM 在五个任务上均优于对应的逐任务最强基线;从头训练的 Dual-WM 平均成功率为 69.5%,逐任务最强非 Dual-WM 对照为 61.4%;不使用 actor-guided proposals,按任务/offset 选取对照并等权平均。完整数值与实验范围见论文。

8. 按方法模块阅读公开代码

阅读入口对应的方法问题
stable_worldmodel/wm/dual_wm/低层状态、高层窗口编码、宏动作与双层动力学
scripts/train/dual_wm.py两阶段训练、递归损失、模块冻结和 MAPS
scripts/plan/eval_wm.py目标初始化、模型载入、评价流程
scripts/plan/config/高低层搜索参数、窗口子目标代价、数据和权重路径
README.md训练、评价和五任务权重下载入口

TwoRoom 配置中的subgoal_cost.mode: dynamic_window_aligned对应预测窗口与高层子目标的对齐比较。可以由此继续追踪HierarchicalCEMSolver。

仓库要求 Python 3.10 及以上。以下按 Linux/bash 展示代码入口:

gitclone https://github.com/DeLin1001/Dual-WM-Official.gitcdDual-WM-Official python-mpipinstall-e".[envs]"

根据 README 准备任务数据、预训练权重和环境后,TwoRoom 的评价入口为:

python-mscripts.plan.eval_wm-cntworoom

默认配置读取datasets/tworoom_planning_o100.h5和checkpoints/TwoRoomCPT/TwoRoomCPT.pt;其他路径可通过STABLEWM_HOME、DUALWM_CHECKPOINT_DIR指定。数据需另外准备。

公开仓库覆盖训练与规划核心流程,其他实验脚本的发布范围以 README 为准。运行前需按公开 README 准备相应数据、权重及环境依赖。

Dual-WM 想探索的是按时间角色组织状态空间:让局部转移和长程目标评价分别学习表征,再用窗口接口、LoRe 与宏动作规划完成协作。当前研究基于离线数据和固定时间抽象,欢迎围绕自适应时间尺度与任务相关目标几何继续讨论。

论文:https://arxiv.org/abs/2609.37644
代码:https://github.com/DeLin1001/Dual-WM-Official

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/4 21:06:57

EMC整改分水岭:从超标频点反推噪声源头

1. 为什么说“从超标频点反推源头”是EMC整改的分水岭?干了十多年硬件设计和EMC整改,我见过太多工程师把EMC测试当成“玄学考试”:样机一送测,辐射发射(RE)曲线像心电图一样满屏毛刺,超标点密密…

作者头像 李华
网站建设 2026/10/4 21:03:20

字节跳动 Trae 智能引擎:把 AI 编程工作流改到 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/4 20:57:33

Angular 响应式编程核心:深入理解 Observable 模式与 RxJS 数据流

文档教程知识库 【免费下载链接】developer-roadmap Interactive roadmaps, guides and other educational content to help developers grow in their careers. 项目地址: https://gitcode.com/GitHub_Trending/de/developer-roadmap 点击查看 免费下载 Observabl…

作者头像 李华
网站建设 2026/10/4 20:46:57

阿里轨迹驱动SWE智能体自进化:TaoToken统一Key下复现与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华