摘要
本文解读 CoRL 2026 论文《Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams》。该论文提出ARMS(Always-onRobot inMulti-modalStreams),通过融合流式视觉触发门、具身状态头与自身动作压缩记忆三个轻量模块,把单个预训练的 $\pi_{0.5}$ 视觉-语言-动作主干改造成能在永不重置的流上「边看、边回忆、边动作」的常开策略;其特别之处在于不新增网络、不加规划器,而是把观看、回忆与避碰全部归约为往主干动作前的上下文里放什么,三个模块异步更新、不阻塞动作,双臂因此可以并发工作。实验表明组合任务动作成功率从最强基线的 28% 提升到 45%(+17 个百分点),跨中断回忆率从 15 提升到 72,且消融显示记忆模块、具身状态头与异步并发三者缺一不可,为长时程、无清晰起止的机器人部署提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 一、常开机器人为什么难:决策信息与动作时刻在时间上被拆开
- 二、研究主线:从问题到结论
- 三、基准/方法设计:一个主干,三个上下文提供者
- 四、分类全景:三路上下文与各自的监督来源
- 五、方法细节:协调降维成一句话,记忆压缩而非流水账
- 六、实验设计与结果
- 七、结果对比总结
- 八、关键发现
- 九、局限性
- 十、常见问题(FAQ)
- ARMS 和「给 VLA 加记忆」的区别在哪里?
- 为什么不用更大的模型,而是三个小模块?
- 「异步并发」到底带来多少收益?
- 这类系统的数据从哪来?
- Probe 与 Online 两个协议为什么要一起用?
- 论文在表述上有哪些值得注意的问题?
- 十一、参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams |
| 标题(中文) | 常开机器人的流式上下文:边看、边回忆、边动作 |
| 作者 | Ding Yi, Peiwen Sun, Chenchu Rong, Jianan Wang, Xili Dai, Xiangyu Yue, Xi Lin |
| 机构 | Shanghai Jiao Tong University · The Chinese University of Hong Kong · Nanjing University · Astribot · Juxi Tech |
| 会议 | CoRL 2026 |
| arXiv | https://arxiv.org/abs/2609.28429 |
| 项目网站 | 暂无(论文承诺公开 ARMS Dataset 与数据构建代码,arXiv v1 未附链接) |
一、常开机器人为什么难:决策信息与动作时刻在时间上被拆开
多模态模型正在从离线框架走向流式理解:模型同时具备主动性(监测流、在条件成立时才动作)与回溯性(回忆流中很久以前发生的事)。对机器人而言,流式不是可选项——机器人活在同一条永不重置的时间线里,相机不会关闭,指令会到来也会失效,它必须同时感知与行动。
论文把这种部署条件概括为三个必须同时成立的需求:
- Watch(观看):为远景触发持续扫描第一人称流,例如「凡是被放到你面前的东西,都收起来」——这条规则可能在设定很久之后才触发;
- Recall(回忆):自指指令(「把第二个你收好的放进箱子」)只能由机器人自身动作的记录来回答,当前帧里根本没有这个信息;
- Act(动作):输出必须是真机上的物理动作,而且要在双臂并发下保持安全——两条手臂共享并不断扰乱同一个场景,执行动作本身就会改变它接下来要理解的画面。
论文进一步指出,把这些能力拆开看,每个单项能力都已被现有工作覆盖,但组合才是难点。下表是论文给出的能力矩阵(Always-on、Proactive、Retrospective、Interruptible、Concurrent 五个轴):
| 系统 | 常开 | 主动触发 | 回忆自身 | 可中断 | 并发执行 |
|---|---|---|---|---|---|
| SwitchVLA | 否 | 否 | 否 | 是 | 否 |
| MemoryVLA | 否 | 否 | 是 | 否 | 否 |
| VITA-E | 是 | 否 | 否 | 是 | 否 |
| Habilis-$\beta$ | 是 | 否 | 否 | 否 | 否 |
| RoboStream | 是 | 否 | 是 | 否 | 否 |
| ARMS(本文) | 是 | 是 | 是 | 是 | 是 |
从历史脉络看,这条线已经走过四级台阶:流式与主动视频理解(VideoLLM-online 把语言模型拉进在线视频流,Dispider 解耦感知/决策/反应并给出异步骨架,后被本文直接继承)→主动性与及时性基准(ProactiveVideoQA 提出 timeliness 指标、RIVER 统一直播/回顾/主动框架,但它们只「回答」,不产生物理动作)→机器人侧的记忆与常开运行(MemoryVLA、RoboStream 走记忆线,SwitchVLA、VITA-E、Habilis-$\beta$ 走常开与并发线)→ARMS 把观看、回忆、动作与双臂并发合到真机上。
从技术定位的角度看,这篇论文的核心动作是把「常开机器人怎么做」从一个机制问题重新表述为一个上下文装配问题:既然每条能力最终都表现为「主干在动作前读到了什么」,那么工程上就不需要为每种需求各造一个模块,只需要为同一个主干准备好三路上下文。换句话说,上下文正在从「世界状态」变成「运行时状态」。
二、研究主线:从问题到结论
图 4(Mermaid 流程图):ARMS 研究主线。问题(永不重置的流、指令会失效)→ 动机(决策信息与动作时刻在时间上分离)→ 数据(约 200 条 staged stream)→ 方法(一个 $\pi_{0.5}$ 主干 + 三路异步上下文)→ 实验(四族闭环评测)→ 结论(45% vs 28%、三模块缺一不可)。
三、基准/方法设计:一个主干,三个上下文提供者
ARMS 的骨架是一个预训练的 $\pi_{0.5}$ 视觉-语言-动作模型(视觉语言 Transformer 加动作专家),原架构完整保留,包括它的视觉编码器。围绕它,论文只加三个轻量模块,每个模块把一路信号变成主干能读的 token 或一句话:
- 视觉触发门:复用 $\pi_{0.5}$ 自己的视觉头,作为高频、非阻塞的二值闸门,判断守卫关心的目标是否出现、条件是否成立;答案为「否」时它全速扫描而不唤醒动作专家,因此常开流不会把算力烧光,而一旦转「是」,编码后的视觉 token 就进入主干上下文。
- 具身状态头:读当前观测与本体感受,向上下文追加一句话,同时携带每条手臂当前的动作原语(抓取、释放、接近、空闲)与一次碰撞检查(按当前与意图运动判断双臂是否在冲突路径上)。
- 自身动作记忆:维护一份动作史 $\mathcal{H}$,每条完成的动作被压成紧凑条目(做了什么、哪只手臂、哪个物体、何时),并做归并,使记忆在无界流上保持有界;回忆指令到达时检索并回写成一句话供主干使用。
三路信号共享同一个上下文接口:第 $t$ 步主干读取的上下文可以写成 $\mathcal{C}t = [\,\text{vis}_t;\ \text{mem}(\mathcal{H}_t);\ \ell;\ \text{state}_t\,]$,动作由 $a_t \sim \pi{0.5}(\mathcal{C}_t)$ 自回归产生。模块在更重的动作前向之外异步更新,主干按需读取,这正是任务级并发成立的原因;同时,由于每个模块的输出都是显式的,它们也可以在不执行动作的情况下被读取,于是同一套系统还能充当「只识别」的探针。
图 1:常开流的任务时间轴。不同任务可以重叠:前景任务、主动任务与回溯查询,处理它们要求模型在对的时刻、对的具身上完成观看、回忆与动作。
四、分类全景:三路上下文与各自的监督来源
图 5(Mermaid 分类图):三路上下文提供者与监督来源。三路信号共享同一个 $\pi_{0.5}$ 主干上下文接口;视觉触发门、具身状态头、自身动作记忆的标签分别来自构造脚本的触发标签、动作原语与碰撞标签、动作史与指令-目标对。
三个模块的监督都来自数据构造脚本本身,而不是策略 rollout,因此不存在循环依赖——这一点在下一节的方法细节里展开。
五、方法细节:协调降维成一句话,记忆压缩而非流水账
第一,把协调降维成一句话。具身状态头不做几何规划,而是输出类似「左臂正在把杯子收进箱子;右臂去够盘子的路径是通的」这样的句子,让主干自己决定是派一条并发动作给空闲手臂,还是把它串行化。论文强调这不是能力缺失,而是刻意的设计:避碰与手臂协调变成主干能读的上下文,而不是一个覆盖主干的模块。
第二,压缩而不是流水账。记忆模块沿用感知-认知双层记忆的思路,但目标是有界:每条完成的动作被摘要成条目并归并,因此在十分钟以上的流上 $\mathcal{H}$ 保持有界。这也解释了同类物体如何区分——两根香蕉无法靠外观分开,只能靠「何时与如何被操作」的记录,检索时按存储的对象 ID 在「最后已知身份」假设下匹配。
第三,监督来自数据构造,而不是策略 rollout。本文的数据是构造出来的:有人按提示摆放物体,第三项需求强制推迟,脚本在摆场时就已经写下了每个模块所需的标签(触发、动作原语、碰撞、指令与目标对)。因此三个模块的训练不依赖它所增强策略的 rollout,避免了循环依赖。
图 2:ARMS 架构。高频感知路径运行门控视觉触发;只有正触发才唤醒低频的推理与动作路径——单个 $\pi_{0.5}$ 主干读取注入的上下文(视觉 token、压缩记忆、语言指令、具身状态头的原语与流),自回归输出双臂动作 token。
六、实验设计与结果
数据。ARMS Dataset 由作者自采,平台是 Cobot Magic 双臂机器人(低成本的 Mobile-ALOHA 式遥操作装置):约200 条永不重置的 staged stream(每条数分钟,有人按提示摆物、双臂同时在干活、第三项需求强制推迟)与约1,200 条短技能示范,覆盖约6 个双臂技能与约15 类物体,其中至少2 组同类干扰物。每条被计分的动作都是真实遥操作示范,不使用合成数据;LIBERO 只作为可选的规模放大。
协议。评测分四族:A 前景任务与守卫并发触发、B 用语言回忆自身过去动作、C 重定位被自身移位的目标、D 双臂皆忙时新守卫到达的仲裁。评测是闭环的——把录制场景重组成常开流并在真机上执行,所以每个物理指标都反映已执行的动作。除六个分项指标(跨中断回忆、前景延续率、自历史一致性、双臂非干扰、过载排序、PAUC 式及时性)外,头条指标是组合任务动作成功率(EAS):一次不中断的运行里,前景完成、每个触发的守卫都由空闲手臂无碰撞服务、回忆返回正确的历史物体、过载排序符合优先级标签,才算成功。
| 方法 | 跨中断回忆 | 前景延续 | 自历史一致 | EAS |
|---|---|---|---|---|
| Fixed-rate VLA(滑窗) | 10 | 22 | 5 | 16 |
| MemoryVLA | 44 | 28 | 40 | 24 |
| SwitchVLA | 15 | 58 | 18 | 28 |
| Recognition$\rightarrow$Controller | 40 | 21 | 45 | 19 |
| ARMS(本文) | 72 | 76 | 82 | 45 |
| Oracle / Human(上界) | 93 | 92 | 96 | 85 |
表中的读法很直接:每个基线只占自己那一角。MemoryVLA 能回忆(44)但前景延续只有 28;SwitchVLA 能延续前景(58)却取不回自身历史动作(15);而高回忆且高延续的区域,除人类/oracle 上界之外只有 ARMS 落在里面(72/76)。端到端 EAS45% vs 28%,提升17 个百分点,但仍比 85% 左右的人类天花板低约40 个百分点——论文因此强调这个设定远未被解决。
消融。论文逐个移除模块:
| 变体 | 跨中断回忆 | 前景延续 | 自历史一致 | EAS |
|---|---|---|---|---|
| ARMS(本文) | 72 | 76 | 82 | 45 |
| 去掉记忆模块 | 31 | 74 | 27 | 32 |
| 去掉自身因果标签 | 50 | 75 | 55 | 38 |
| 记忆去掉时序序次 | 48 | 75 | 58 | 36 |
| 去掉具身状态头 | 58 | 58 | 81 | 34 |
| 硬中断(无异步并发) | 68 | 41 | 80 | 30 |
去掉记忆模块,回忆率从 72 掉到 31(低于单类随机水平);只去掉记忆中的时序序次,类别还认得但对「第二个」的序数回忆被毁掉,EAS 降到 36;去掉具身状态头,前景延续从 76 掉到 58、双臂非干扰从 78 掉到 68;把异步并发换成硬中断伤得最重,前景延续 76→41、非干扰 78→38。其中「去掉自身因果标签」这一组最能说明设计要义:保持同样的记忆容量,只把「哪只手臂、何时」这类来源信息抹掉、退化成世界状态记忆,回忆率就从 72 掉到 50、自历史一致性从 82 掉到 55——收益来自来源标注,而不是更大的记忆。
真机与长流。真机上做了三轮随机化任务布置、每轮 20 次试验($N=60$/方法/段):
| 评测段 | 指标 | ARMS | 最强基线 |
|---|---|---|---|
| 观看 + 并发(清杯时收水果) | 成功率 / 前景恢复 | 65 / 70 | 20 / 28 |
| 回忆(「第二个你收好的」) | 成功率 | 60 | 13 |
| 自扰动(双臂遮挡) | 重定位成功率 | 62 | 18 |
| 长流($\geq$10 min 不重置) | 保持率 | 67 | 30 |
差距最大的两段恰好是「自身动作改变了未来状态」的地方:回忆段 60 vs 13,自扰动段 62 vs 18。而在十分钟以上永不重置的流里,记忆保持有界,策略保持 67% 而最强基线 30%;单张 80 GB 加速卡上,双臂同时执行时中位触发到决策时延低于 200 ms。
图 3:真机定性结果(单条永不重置的并发 episode)。前景行是把杯子清进箱子;下方 initial/cue/act/outcome 四列显示两个主动守卫先后触发(香蕉、胡萝卜),空闲手臂各自收好;随后的自指指令「把第二个你收好的放进箱子」在双臂遮挡下解析为胡萝卜并装箱。
七、结果对比总结
图 6(Mermaid 流程图):结果对比总结。EAS 45% vs 28%(+17pp)分叉为三条证据:回忆 72 vs 15(来源标注承重)、前景延续 76 vs 28(异步并发承重)、长流保持 67% vs 30%(记忆有界);三条证据共同指向同一处残差——真机执行,距人类上界 85% 约 40 个百分点。
八、关键发现
- 组合不可分解:五个能力轴(常开、主动、回忆、可中断、并发)里,已有系统各占一角;论文的能力矩阵显示只有 ARMS 五个轴全中。
- EAS 45% vs 28%(+17pp),而 Oracle/Human 上界是 85%——差距被论文明确留在台面上。
- 跨中断回忆 72 vs 15:MemoryVLA 能回忆但前景崩塌(28),SwitchVLA 能延续前景却取不回自身历史(15),两者不可兼得是基线共同的天花板。
- 三个模块各自承重:去掉记忆、具身状态头、异步并发,EAS 分别掉到 32、34、30(基准 45)。
- 来源标注比容量更值钱:同容量下去掉「哪只手臂、何时」,回忆 72→50、自历史一致性 82→55。
- 异步本身就是能力:把异步并发换成硬中断,前景延续 76→41、非干扰 78→38,说明「把动作派给空闲手臂」优于打断前景。
- 瓶颈在执行而非感知:Probe 协议下识别率保持 80% 以上,而动作成功率在并发与自扰动下衰减——这是一个动作问题,不是视频问答。
- 长流不退化:$\geq$10 min 不重置流上记忆保持有界,保持率 67% vs 基线 30%。
九、局限性
- 真机证据规模小、平台单一:全部真机结果来自同一台 Cobot Magic,staged stream 只有约 200 条,完整过载机制主要在 D 族被触发,证据最薄。
- 守卫由人预先写定:站立规则是人写下的,模型不会自己发现新的值得守候的条件。
- 优先级是固定档位:默认过载策略使用数据集定义的优先级层,不随场景学习或协商。
- 真机演示的回忆可能借助外观:该演示用的是两个不同物体;只能靠来源与次序区分的同类物体情形与完整过载,只在数据集的 B、D 族上量化,更大规模的真机评测留作未来工作。
作者给出的下一步是更大规模的真实数据、可学习的守卫与优先级,以及更丰富的过载策略;论文同时承诺公开 ARMS Dataset 与数据构建代码。
十、常见问题(FAQ)
ARMS 和「给 VLA 加记忆」的区别在哪里?
多数记忆工作记的是世界状态(场景里有什么、发生过什么转移),而 ARMS 记的是自身因果:哪只手臂、在何时、做了哪个受守卫驱动的动作。论文用同容量对照证明这一点是承重的——抹掉来源标签,回忆率从 72 掉到 50、自历史一致性从 82 掉到 55。
为什么不用更大的模型,而是三个小模块?
因为论文把问题定位为上下文装配而不是容量或延迟:主干($\pi_{0.5}$)完整复用,只有三路上下文是新增的,且在四个基线共享同一初始化与训练预算的前提下取得 +17pp。单卡 80 GB、双臂并发下中位时延低于 200 ms 也是这个设计的结果。
「异步并发」到底带来多少收益?
硬中断对照给出了答案:把异步并发换成硬中断,前景延续从 76 掉到 41、双臂非干扰从 78 掉到 38,EAS 从 45 掉到 30——比去掉任一模块都更伤。
这类系统的数据从哪来?
全部来自自采的真实遥操作:约 200 条 staged stream 加约 1,200 条技能示范。关键在于数据是构造的,构造脚本本身就是标注来源,因此模块监督不依赖策略 rollout,也不存在循环依赖。
Probe 与 Online 两个协议为什么要一起用?
Online 只评端到端动作,Probe 只评「是否知道该在何时对什么动作」。两者对照才能把失败归因到感知还是执行:本文的数据显示识别率保持 80% 以上而动作掉档,所以残差在执行侧。
论文在表述上有哪些值得注意的问题?
作者块把单位写成 Jiaotong(规范为 Jiao Tong),参考文献中有一处作者名乱码;「识别率超过 80%」这一关键数字只出现在散文里,没有对应表格;数据集与代码承诺公开,但正文没有链接,也没有致谢章节。这些都是引用时需要留意的细节。
十一、参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2609.28429
- 一作主页(Ding Yi,SJTU):https://onedonedone.com/
- 通讯作者主页(Xi Lin,SJTU 计算机学院):https://www.cs.sjtu.edu.cn/jiaoshiml/linxi.html
- 资深作者主页(Xiangyu Yue,CUHK MMLab):https://xyue.io/
- Dispider(CVPR 2025,本文继承的异步非阻塞骨架):https://arxiv.org/abs/2501.03218
- MemoryVLA(ICLR 2026,记忆基线):https://arxiv.org/abs/2508.19236
- RoboMME(ICML 2026,机器人记忆评测基准):https://arxiv.org/abs/2603.04639
- ControlVLA(CoRL 2025,作者 Jianan Wang 的通讯工作):https://arxiv.org/abs/2506.16211
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)