news 2026/9/24 17:47:11

伯克利等发布 TANGO:首个面向杂乱环境的人形机器人全身VLA导航框架

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
伯克利等发布 TANGO:首个面向杂乱环境的人形机器人全身VLA导航框架

首个用于杂乱环境中语言条件化的人形穿越的全身VLA框架

——TANGO

目录

01 TANGO整套系统设计:数据管线、模型架构、真机部署

PET:Plan‑Edit‑Track仿真数据生成管线

三系统VLA模型架构

真实机器人云‑边部署架构

02 实验:仿真基准 + 杂乱场景 + 真机零样本测试

03 结语


传统人形机器人导航大多沿用轮式机器人的老思路,把导航简化成二维平面路径规划。

但现实室内充满沙发、桌椅、低矮障碍物、狭窄过道、头顶悬挂物体,机器人不是一个质点,胳膊、躯干、腿部都会发生碰撞。就算规划出一条看起来可行的路径,机器人庞大的躯体可能根本挤不过去。

这也是很多人形机器人在真实家庭、办公场景行动笨拙的根源。

伯克利联合北大、清华、港大、普林斯顿最新研究 TANGO,提出了一套面向杂乱室内环境的全身视觉‑语言‑动作(VLA)导航框架。

它不输出二维航点,直接输出29自由度全身关节动作,整套模型完全在仿真中训练,不需要任何真实世界导航数据,把人形导航从“找路”推进到“全身协同穿行”的阶段。

01 TANGO整套系统设计:数据管线、模型架构、真机部署

TANGO 采用端到端根据语言指令 + 第一视角RGB图像,直接输出完整全身关节目标角度,把导航决策和全身运动生成合并成一个统一模型。

整套工作可以拆成三块:PET仿真自动数据生成管线、三系统VLA模型架构、云‑边分离真机部署系统。

其中PET自动生成大规模高质量仿真轨迹,是这套方案能够跑通的重要前提。

▲图|TANGO架构以及PET计划‑编辑‑跟踪数据生成管线总览

PET:Plan‑Edit‑Track仿真数据生成管线

训练全身VLA最大的阻碍就是数据

动捕采集全身穿行轨迹成本极高,很难大批量生成大量“侧身走、下蹲、跨障碍”带语言标注的样本。TANGO没有依赖真人动捕,提出PET离线自动合成管线,自动生成无碰撞全身导航轨迹。

  • Plan规划阶段

在增强后的室内场景使用A*算法做平面路径搜索,代价函数加入障碍物距离惩罚。

检测到狭窄通道时自动修改机器人朝向,生成螃蟹式侧步行走参考轨迹;把路径转为速度指令交给SONIC运动规划器,生成基础人形行走步态。

  • Edit编辑阶段

这是产生避障全身行为的核心。利用三维符号距离场SDF,通过伪力软约束修改全身IK逆运动学结果。遇到头顶障碍物触发下蹲,地面低矮障碍物修改落脚点实现跨步越障,狭窄通道推动躯干、手臂远离墙体。

这个阶段只修改姿态,保留原始步态节奏,不会破坏行走节律。

  • Track跟踪过滤阶段

把编辑后的轨迹丢进仿真运动跟踪器做可行性校验,会发生碰撞、动力学不可行的轨迹直接丢弃;保留编辑阶段的参考运动作为监督信号,而不是跟踪之后的轨迹,保证运动的拟人化。

整套管线产出64633条完整轨迹,消耗211个RTX PRO 6000 GPU小时。数据集包含三类典型障碍:地面障碍(需要跨步)、侧向障碍(需要侧身)、上方障碍(需要下蹲)。

▲图|环境增强生成的三类障碍物场景示例图

三系统VLA模型架构

TANGO采用经典三系统划分:System‑2感知推理、System‑1动作专家、System‑0底层运动跟踪器。

  • System‑2(感知)

骨干使用Qwen2.5‑VL‑7B,使用InternVLA‑N1权重做热启动。处理前后双相机RGB图像,借助BATS预算感知token采样压缩长视频历史,把图像token与语言指令融合,输出隐式上下文向量z。

  • System‑1(动作专家)

基于流匹配的MM‑DiT扩散Transformer。以感知输出隐向量、机器人本体关节状态作为输入,一次性预测未来一段窗口的29维关节角度 + 基座6D姿态的动作块。训练时引入RTC训练时动作分块条件,模拟在线流式推理,解决动作块之间的运动不连续问题。

  • System‑0(执行层)

SONIC运动跟踪器,接收预测的参考关节轨迹,输出高频低级别电机控制指令。模型本身不需要学习底层电机控制,专注输出参考运动轨迹。

联合损失由VideoQA跨熵损失、流匹配损失两部分组成,在保留通用视觉语言能力的同时学习全身动作生成。

这里需要区分:模型输出的不是电机力矩,是期望关节参考角度,真正的动力学稳定由SONIC跟踪器负责。

这种设计的好处是模型不用处理复杂的电机控制细节;代价是最终性能会被底层跟踪器的上限约束。

▲图|杂乱环境下人形全身导航示意图

真实机器人云‑边部署架构

硬件为Unitree G1人形机器人,采用云‑边缘分离架构:

  1. 云端服务器(RTX PRO 6000):运行算力消耗大的VLA模型,0.5秒做一次推理,输出30Hz频率的动作块。
  2. 机器人机载Jetson Orin NX:只跑SONIC跟踪器,闭环控制频率200Hz。
  3. 传感器:RealSense D455、D435i获取前视、下视RGB图像,图像与本体状态通过网络传到服务器,往返延迟大约20ms。
  4. 配套网页控制面板:下发语言指令,可视化观测和机器人预测运动。

▲图|TANGO真实世界部署系统示意图

推理得到的动作块会重采样到50Hz下发到机器人。这种分离方案把大模型沉重计算放到服务器,机载只负责高频控制,但同时引入网络延迟依赖。

02 实验:仿真基准 + 杂乱场景 + 真机零样本测试

实验分为VLNVerse标准导航基准、杂乱仿真环境评估、真实机器人测试、消融实验。

指标除导航常用SR、SPL、NE之外,新增碰撞率CR,统计发生至少一次碰撞的episode占比,专门衡量全身穿行安全性。

很多基线方案是“传送模式”评测,也就是不考虑物理执行,直接把理想路径拿出来算指标;只有TANGO是完整跑在物理仿真,存在摔倒、碰撞等物理失败,两者指标不能直接简单对比。

▲表|VLNVerse基准结果

  • 在VLNVerse基准测试集上

TANGO取得最优成功率SR,最低导航误差NE,SPL指标接近SOTA基线。

SPL没有做到第一,研究给出的解释是底层跟踪器为安全选择保守运动,绕行障碍物,路径更长,牺牲一部分路径效率换取安全性。

▲表|增强杂乱仿真环境评估结果

  • 在布满障碍物的增强场景

对比InternVLA‑N1搭配不同底层控制器的模块化方案。

TANGO碰撞率CR降低到9.90%;值得一提,对比基线HumanoidPF还额外使用激光雷达感知,而TANGO仅使用RGB图像输入,在感知信息更少的前提下实现更低碰撞。

▲表|真实世界导航定量实验结果

  • 真机实验设置三类场景

短距离二维导航、长距离二维导航、带障碍物三维杂乱场景。

每类场景15次试验,统计成功次数、每轮平均碰撞次数。TANGO在全部三类场景中,任务成功率更高,平均碰撞次数显著低于InternVLA‑N1 + Unitree官方控制器基线。

▲图|TANGO真实世界部署定性结果图

真机演示场景包括:30米长距离办公环境导航、窄通道侧身通过、下蹲躲避头顶障碍物、跨步越过地面障碍。全程没有使用任何真机导航数据训练,属于零样本迁移。

消融实验验证几个关键组件价值:

  1. 去掉RTC实时分块机制:成功率暴跌,碰撞率显著上升。说明动作块之间连续性对人形连续运动至关重要。
  2. 移除motion‑editing运动编辑模块:碰撞率大幅上涨,证明仿真阶段生成带避障行为的监督数据是关键。
  3. 替换SONIC为另一个通用全身控制器ScaleBFM:性能小幅下降,依旧可用,说明整套VLA模型具备对接不同底层跟踪器的兼容性。

▲表|动作空间消融实验结果

其中2D变体Ours‑2D,只预测平面导航,不输出全身关节。一旦开启真实物理执行,性能直接断崖下跌。

这在一定程度上说明:只做二维路径规划,在人形机器人的杂乱环境中是行不通的

03 结语

TANGO代表人形机器人导航一个重要转向:导航不只是找到一条地图上的路径,而是要考虑机器人整个身体如何穿过环境。

过去大家更多关注人形机器人的操作、跑跳能力;而家庭、办公室的真实落地,恰恰大量需要这种“挤过窄过道、低头避开悬挂物、抬脚跨过地上杂物”的日常穿行能力。

当然,这套方案也留下不少开放方向:如何把深度、激光融合进VLA模型?如何压缩VLA模型,摆脱对云端服务器依赖?如何把全身导航和操作任务结合,一边穿行一边完成物体交互?

目前还是研究原型,距离消费级人形机器人成熟产品还有距离,但TANGO证明:全身VLA模型结合大规模仿真数据,可以让机器人听懂语言指令,自主调整全身姿态穿行在人类的杂乱环境。

Ref

论文标题:TANGO : Humanoid Navigation in Cluttered Environments with a Whole‑Body Vision‑Language‑Action Model

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 17:46:59

Oracle迁移国产库最怕什么?不可逆风险的四个关口与实测验证方法

大家好,我是数据库小学妹 👋我踩过的坑,你别再踩。 上周跟一个正在做去 O 的朋友吃饭,聊到他们上线前的最后一晚。他说全组通宵没干别的,就干了一件事:把"万一不行怎么回去"写成方案。三十多页的…

作者头像 李华
网站建设 2026/9/24 17:46:36

iPSC多谱系分化如何选Laminin亚型?LN521、LN111、LN511、LN411、LN332应用解析

摘要: 人体基底膜中的Laminin并不是单一蛋白,不同α、β、γ链组合形成不同亚型,并在多能干细胞巢、神经、血管、胰岛、皮肤、心肌和骨骼肌等组织中呈现不同表达模式。因此,iPSC定向分化中的Laminin选型不能简单理解为“所有流程都…

作者头像 李华
网站建设 2026/9/24 17:45:28

【Matlab】运动目标无人机视觉跟随控制实现

【Matlab】运动目标无人机视觉跟随控制实现 一、引言 随着智能无人机技术的快速迭代,无人机自主跟随飞行已经成为智能巡检安防监测野外追踪物资跟随运输等场景的核心功能。传统无人机跟随作业多依靠人工遥控或GPS定点跟随模式,存在明显的技术短板。GPS跟随依赖卫星定位信号…

作者头像 李华
网站建设 2026/9/24 17:45:20

基于 Java Spring Boot 的育儿所服务管理系统设计与实现

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 1. 引言 随着社会对婴幼儿照护服务需求的持续增长,育儿所(托育机构)的日常管理面临越来越多的挑战。传统的人工登记、纸质台账和分散…

作者头像 李华
网站建设 2026/9/24 17:44:48

CRTP 编译期多态与静态接口:没有虚函数也能多态

继承 + 虚函数不是 C++ 里实现「一套接口、多种实现」的唯一路子。如果你想要的是编译期就定下来的多态——没有运行期查虚表(virtual table,vtable)、调用能被内联(inline)、对象还更小——CRTP 就是这个需求的标准答案。这篇用真跑出来的 sizeof 和计数器实例,把 CRTP …

作者头像 李华