1. 具身智能到底在解决什么问题
1.1 从“会聊天”到“能干活”的分水岭
过去几年,大语言模型把“理解语言”这件事做到了令人咋舌的程度。你问它一个法律条款,它能给你逐条拆解;你让它写一段营销文案,它三秒出稿。但如果你把同样一个模型装进机器人身体里,让它去厨房把桌上的杯子拿过来,它大概率会愣在原地——不是因为它“笨”,而是因为它从来没有真正理解过“杯子在桌上”这句话对应的物理世界是什么样子。
这就是具身智能要解决的核心矛盾:语言空间里的常识,和物理空间里的操作,中间隔着一道巨大的鸿沟。语言模型知道“杯子”这个词和“易碎”“圆柱形”“可以装水”这些属性高度相关,但它不知道一个真实的杯子有多重、表面摩擦系数是多少、从哪个角度抓取最稳、抓起来之后手臂关节该怎么协调。这些知识不在文本里,在身体与环境的交互里。
具身智能(Embodied AI)这个方向,说白了就是让智能体拥有一个“身体”,通过感知、决策、行动的闭环,在真实物理世界里完成具体任务。它和传统机器人学的区别在于:传统机器人学是“我给你写好程序,你照着执行”,而具身智能是“我给你一个目标,你自己去理解环境、规划动作、应对变化”。
2026年这个时间节点之所以关键,是因为三件事同时成熟了:机器人基础模型的泛化能力跨过了可用门槛,仿真到真实的迁移(Sim-to-Real)成本大幅下降,硬件供应链把整机成本压到了可以规模化部署的区间。这三件事凑在一起,才让“能干活的机器”从实验室demo变成了可以谈落地的产品。
1.2 谁需要看这份指南
如果你是一个AI工程师,想从纯软件方向往具身智能转,这份指南会帮你理清VLA模型、世界模型、仿真训练这几条技术线的位置和关系。如果你是一个机器人方向的从业者,想了解大模型到底能给传统机器人栈带来什么改变,这里会拆解具体的融合方式。如果你是一个产品经理或者创业者,在评估具身智能赛道的切入机会,这里会给你一个从技术成熟度到落地场景的完整判断框架。
我不打算写成学术综述,也不会堆砌论文引用。这篇东西更像是一个在这个方向上踩了两年坑的人,把自己对技术脉络的理解、实操中的关键决策点、以及那些“文档里不会写但实际会要命”的细节,一次性倒出来。
2. VLA模型:具身智能的“大脑”到底长什么样
2.1 VLA是一个模型还是两个模型
这个问题在社区里被问烂了。先说结论:VLA可以是一个模型,也可以是两个模型的组合,取决于你用什么架构。
VLA的全称是Vision-Language-Action,视觉-语言-动作。它的核心思路是把三种模态的信息统一到一个框架里:视觉输入告诉模型“世界现在是什么样”,语言指令告诉模型“我要你做什么”,动作输出告诉模型“你应该怎么动”。
最早的VLA实现是“拼接式”的:用一个预训练的视觉编码器(比如ViT)提取图像特征,用一个预训练的语言模型(比如LLaMA)理解指令,然后在中间加一个跨模态对齐模块,最后接一个动作解码器输出关节角度或末端执行器位姿。这种方案里,视觉、语言、动作三个部分各有各的模块,训练的时候也是分阶段进行的。你可以说它是“三个模型拼起来的”。
但2025年之后,主流方案越来越倾向于端到端的统一架构。也就是说,一个Transformer吃掉所有输入——图像patch、文本token、本体感觉向量——然后直接输出动作token。这种方案的代表就是RT-2系列和后来的开源复现。端到端的好处是信息不会在模块边界处丢失,坏处是训练数据量要求极高,而且调试起来像个黑盒。
实操建议:如果你是刚入门,先从拼接式架构入手。它的每个模块都可以单独替换和调试,你能清楚地知道问题出在视觉编码不够好、还是语言理解有偏差、还是动作解码不准确。等你对整个pipeline有了手感,再考虑端到端方案。
2.2 VLA是怎样训练的
训练一个VLA模型,数据是最大的瓶颈。你需要的是**(图像,指令,动作)三元组**。图像是机器人摄像头看到的画面,指令是人类给的自然语言,动作是机器人实际执行的动作序列。
数据来源主要有三个渠道:
第一个渠道是遥操作采集。让人戴着VR头显或者使用动捕设备,远程操控机器人完成任务,同时记录所有传感器的数据。这种方式采集的数据质量最高,因为动作是真实执行的,但成本也最高——一个熟练的遥操作员一天可能只能采集几十条有效轨迹。
第二个渠道是仿真环境生成。在MuJoCo、Isaac Sim这类物理引擎里,让机器人在虚拟环境中执行任务,自动记录数据。这种方式可以大规模并行,一天生成几十万条轨迹不是问题。但仿真环境和真实世界之间存在“现实鸿沟”,模型在仿真里学到的策略直接搬到真机上往往会失效。
第三个渠道是互联网视频。人类在YouTube上发布的做饭、修理、整理房间的视频,包含了大量“手-物体”交互的视觉信息。但这些视频没有动作标签,也没有机器人本体感觉数据,只能用来做预训练,让模型学习物理常识和任务结构。
实际训练流程通常是三阶段:
- 视觉-语言预训练:用互联网图文对和视频,让模型学会“看到什么”和“听到什么”之间的对应关系。这个阶段不涉及动作。
- 仿真动作微调:在仿真环境里,用大量自动生成的(图像,指令,动作)数据,让模型学会把语言指令映射到动作序列。这个阶段可以加入域随机化(Domain Randomization),让模型对光照、纹理、物体位置的变化更鲁棒。
- 真实数据精调:用遥操作采集的真实数据,对模型做最后的微调。这个阶段的数据量不需要很大,几百到几千条高质量轨迹通常就够了,但要求覆盖目标任务的核心变化维度。
踩过的坑:很多人以为仿真数据越多越好,实际上如果仿真环境的物理参数和真实世界偏差太大,模型会学到错误的物理直觉。比如仿真里摩擦力设得偏高,模型就会习惯用更大的力去抓取,到了真机上直接把鸡蛋捏碎。我的经验是,仿真数据的量控制在真实数据的10到20倍就够了,再多边际收益很低。
2.3 派0 VLA的架构选择与取舍
“派0 VLA”这个说法在社区里流传很广,它指的是一种特定的架构范式——以预训练视觉语言模型为骨干,通过动作专家模块(Action Expert)输出连续动作。这个范式的核心设计哲学是:不要重新发明轮子,把已经在大规模图文数据上训练好的视觉语言能力直接拿过来用,只训练一个相对轻量的动作头。
具体来说,骨干网络用的是已经训练好的VLM,它的参数在训练动作头的时候可以冻结,也可以做小学习率的微调。动作专家模块通常是一个Diffusion Policy或者Flow Matching头,它接收VLM输出的融合特征,生成连续的动作序列。
这种设计的好处非常明显:样本效率极高。因为VLM已经理解了“杯子”“桌子”“红色”“左边”这些概念,动作头只需要学习“在这个视觉场景下,听到这个指令,应该输出什么动作”这一层映射。通常几百条轨迹就能让模型在新任务上达到可用的成功率。
坏处是推理延迟。VLM本身参数量大,加上Diffusion Policy需要多步去噪,整个推理链路在边缘设备上跑起来很吃力。实际部署时通常需要做模型量化、算子融合、甚至把VLM和动作头拆到不同芯片上跑。
一个实用的折中方案:把VLM的最后一层或两层解冻,用较小的学习率参与微调。这样既保留了预训练知识,又让视觉特征能适应机器人视角的特殊性(比如鱼眼畸变、手腕相机的近距离特写)。
3. 世界模型:让机器人在“脑内”预演未来
3.1 世界模型推理公式到底在算什么
世界模型的核心思想是:让智能体学会预测“如果我做这个动作,世界会变成什么样”。这个能力一旦具备,机器人就可以在行动之前在“脑内”模拟不同动作的后果,选择最优策略,而不是盲目试错。
从数学形式上看,世界模型要学习的是一个条件概率分布:
p(s_{t+1} | s_t, a_t)
其中s_t是当前状态(图像、关节角度、物体位姿等),a_t是当前动作,s_{t+1}是下一个状态。如果能把这个世界模型学准,就可以用它来做规划:给定目标状态s_goal,反向搜索或者前向采样出一串动作a_1, a_2, ..., a_T,使得从s_0出发经过这串动作后到达s_goal。
更高级的世界模型还会引入隐变量z,把高维的视觉观测压缩到一个低维的 latent space 里做预测:
p(z_{t+1} | z_t, a_t)
这样做的好处是计算量大幅降低,而且模型可以忽略掉视觉中与任务无关的细节(比如背景墙纸的花纹),只关注与动作相关的物理状态变化。
实际训练世界模型时,最常用的损失函数是重建损失+预测损失的组合。重建损失确保latent能还原出原始观测,预测损失确保latent的转移符合真实物理规律。有些方案还会加入对比学习损失,让相似状态的latent表示更接近。
关键细节:世界模型的预测步长不需要很长。实验表明,预测未来3到5步的短期世界模型,配合模型预测控制(MPC),效果往往比预测未来几十步的长期世界模型更好。因为长期预测的误差累积太快,预测出来的“未来”已经和真实情况偏离太远,反而误导决策。
3.2 世界模型和VLA怎么配合
VLA和世界模型不是二选一的关系,它们解决的是不同层次的问题。VLA解决的是“看到场景和指令,直接输出动作”的反射式决策,世界模型解决的是“如果这样做会怎样”的推演式决策。
一个典型的配合方式是分层架构:
- 上层是世界模型:接收当前观测,生成多个候选动作序列,并预测每个序列的后果。
- 下层是VLA:接收选定的动作序列中的第一个动作作为“子目标”,生成具体的关节控制指令。
这种架构的好处是,世界模型负责“想清楚再动”,VLA负责“动得精准”。在需要多步推理的任务里(比如“把桌上的垃圾扔进垃圾桶,然后把杯子放到架子上”),世界模型可以做任务级规划,VLA做动作级执行。
另一种配合方式是世界模型作为VLA的训练环境。在真实世界里训练VLA成本太高,但在世界模型里“想象”出各种场景和动作后果,就可以低成本地生成大量训练数据。这种方案的关键是世界模型的预测精度要足够高,否则学到的策略在真实世界里会失效。
3.3 世界模型的落地难点
世界模型最大的难点是物理一致性。视觉上看起来合理的预测,物理上可能完全错误。比如模型可能预测“杯子被推下桌子后会悬浮在空中”,因为训练数据里没有足够的坠落样本。这种物理幻觉在长尾场景里尤其致命。
另一个难点是计算开销。世界模型需要在每个决策步都做多次前向推理来评估不同动作序列,这对边缘设备的算力是巨大考验。实际部署时通常需要把世界模型做得很小(比如用MobileNet级别的骨干),或者只在关键决策点调用世界模型,日常控制还是靠VLA直接输出。
我的经验:世界模型在接触丰富的任务(比如插拔、拧螺丝、叠衣服)里价值最大,因为这些任务的物理交互复杂,纯反射式的VLA很难处理。而在自由空间运动(比如导航、避障)里,世界模型的边际收益不高,传统规划算法反而更稳定。
4. Sim-to-Real:从仿真到真实的惊险一跃
4.1 为什么仿真训练的策略一到真机就废
Sim-to-Real是具身智能里最“玄学”的环节。你在仿真里把成功率刷到95%,部署到真机上可能直接掉到20%。原因通常出在以下几个方面:
视觉差异:仿真渲染的图像和真实相机拍出来的图像,在光照、纹理、噪声分布上都有明显差异。模型在仿真里学会了“看到这种像素模式就抓取”,到了真机上像素模式变了,模型就懵了。
物理参数差异:仿真里的摩擦系数、质量、刚度、阻尼都是人为设定的,和真实物体有偏差。模型在仿真里学到的力控策略,到了真机上可能因为摩擦力不同而完全失效。
执行器差异:仿真里的电机是理想模型,给什么指令就输出什么力矩。真实电机有延迟、有死区、有齿隙、有温漂。这些非线性因素在仿真里很难精确建模。
传感器噪声:真实相机的噪声模式、IMU的漂移、关节编码器的量化误差,在仿真里通常被简化甚至忽略。
4.2 域随机化:让模型学会“以不变应万变”
域随机化(Domain Randomization)是目前最主流的Sim-to-Real方案。核心思路很简单:与其费劲把仿真做得和真实一模一样,不如在仿真里随机变化各种参数,让模型学会忽略这些变化,只关注任务相关的本质特征。
具体操作时,在每次训练episode开始时,随机采样一组环境参数:
- 光照方向和强度:在±30%范围内随机
- 物体纹理和颜色:从一组预设材质中随机选择
- 相机位置和角度:在±5cm和±5°范围内随机
- 摩擦系数:在真实值±40%范围内随机
- 物体质量:在真实值±30%范围内随机
- 电机延迟:在0到20ms之间随机
这样训练出来的策略,对真实世界里的这些变化会有很强的鲁棒性。代价是训练时间变长,因为模型需要覆盖更大的参数空间。
实操心得:域随机化的范围不是越大越好。如果随机范围太大,模型会学到一个“万能但平庸”的策略,在任何一个具体场景下都表现一般。我的做法是先用大范围随机做预训练,然后用真实数据做精调时逐步收窄随机范围,让模型在保持鲁棒性的同时提升精度。
4.3 真实数据精调的策略
仿真预训练之后,必须用真实数据做精调。但真实数据采集成本高,所以要用在刀刃上。
我的策略是分层精调:
第一层,视觉对齐。用真实相机拍摄一批静态场景图像,只训练视觉编码器,让视觉特征分布向真实图像靠拢。这个阶段不需要动作标签,只需要图像。
第二层,动作对齐。用少量遥操作数据(50到100条轨迹),训练动作头适应该机器人的具体动力学特性。这个阶段冻结视觉编码器,只更新动作头。
第三层,任务精调。用目标任务的数据(200到500条轨迹),端到端微调整个模型。这个阶段学习率要设得很小,避免破坏预训练知识。
整个流程下来,通常一周左右可以完成一个新任务的适配。如果跳过前两层直接做任务精调,需要的真实数据量会翻好几倍,而且成功率不稳定。
5. 机器人基础模型与操作系统:具身智能的“安卓”之争
5.1 机器人基础模型到底“基础”在哪
“机器人基础模型”这个词容易让人联想到大语言模型里的“基础模型”——一个在海量数据上预训练、可以微调到各种下游任务的通用模型。在具身智能领域,这个类比基本成立,但有几个关键区别。
语言基础模型的预训练数据是文本,互联网上取之不尽。机器人基础模型的预训练数据是“感知-动作”轨迹,互联网上没有现成的,必须自己采集或生成。这就决定了机器人基础模型的规模不可能像语言模型那么大——目前最大的机器人基础模型参数量在几十亿级别,而语言模型已经到万亿级别。
另一个区别是评估困难。语言模型的评估可以用标准测试集,机器人基础模型的评估必须在真实物理环境里跑,受硬件、环境、任务设置的影响极大。同一个模型在不同实验室的机器人上表现可能天差地别。
目前机器人基础模型的主流架构是Transformer+动作头,预训练任务包括:掩码图像建模、未来帧预测、指令跟随、动作克隆等。预训练数据来自多个来源的混合:仿真数据、遥操作数据、互联网视频、以及不同机器人平台采集的数据。
5.2 具身智能操作系统的核心能力
具身智能操作系统(Embodied AI OS)不是传统意义上的机器人操作系统(如ROS),它更像是一个模型运行+任务调度+硬件抽象的中间层。
核心能力包括:
模型服务:管理VLA模型、世界模型、感知模型的加载、推理、版本切换。支持模型的热更新,让机器人在不重启的情况下切换到新模型。
任务编排:把高层指令(“收拾客厅”)拆解成子任务序列(“捡起地上的衣服→放进洗衣篮→把书放回书架”),并调度相应的模型和技能来执行。
硬件抽象:屏蔽不同机器人硬件的差异,让上层模型不需要关心底层是六轴机械臂还是人形机器人。这层通常定义一套标准的传感器接口和动作接口。
数据回流:记录机器人在执行任务过程中的所有感知和动作数据,用于后续的模型迭代。这是具身智能系统持续进化的关键。
安全监控:实时监测机器人的状态,在检测到异常(碰撞、过热、指令冲突)时触发安全策略。
目前这个领域还没有出现像Android在手机领域那样的绝对主导者。ROS 2在传统机器人社区根基深厚,但对AI模型的支持不够原生。一些创业公司在做专门面向具身智能的OS,但生态还在早期。我的判断是,未来两年内会出现一个事实标准,但具体是谁还不好说。
5.3 标准体系对行业的影响
《人形机器人与具身智能标准体系(2026版)》的发布,标志着这个行业开始从“野蛮生长”进入“有章可循”的阶段。标准体系主要覆盖几个方面:
硬件接口标准:统一机械臂的电气接口、通信协议、供电规格。这意味着不同厂商的机械臂可以互换使用,整机厂商不再被单一供应商绑定。
数据格式标准:统一感知数据和动作数据的存储格式。这对模型训练意义重大——不同来源的数据可以直接混合训练,不需要做繁琐的格式转换。
安全标准:定义机器人在人机协作场景下的力限制、速度限制、急停响应时间等。这是机器人进入家庭和公共场所的前提。
评估标准:定义具身智能系统的性能评估方法,包括任务成功率、泛化能力、鲁棒性等指标。这让不同方案之间有了可比性。
标准体系的建立会加速行业分工:做硬件的专注硬件,做模型的专注模型,做应用的专注应用。这对整个行业的规模化是好事,但对试图做全栈的公司来说,意味着每个环节都要面对更专业的竞争对手。
6. 具身智能学习路线:从入门到能上手做项目
6.1 基础阶段:补齐三个方向的知识
具身智能是典型的交叉学科,需要同时具备三方面的基础:
机器学习基础:理解Transformer架构、注意力机制、扩散模型、强化学习的基本概念。不需要推到数学公式,但要能看懂论文里的架构图,知道每种方法的适用场景。
机器人学基础:理解运动学(正运动学、逆运动学)、动力学、轨迹规划、控制理论。重点是建立“三维空间中的位姿变换”这个直觉,以及“力与运动的关系”这个物理直觉。
计算机视觉基础:理解图像特征提取、目标检测、位姿估计、点云处理。具身智能里视觉是最主要的感知模态,视觉能力的强弱直接决定模型的上限。
这三个方向不需要学到专家级别,但每个方向至少要能读懂中等难度的论文,能复现简单的demo。
6.2 进阶阶段:动手跑通一个完整pipeline
基础知识补齐之后,最重要的是动手。我建议的路径是:
第一步,在仿真环境里搭建一个简单的抓取任务。用MuJoCo或Isaac Sim,加载一个机械臂模型和一个物体,写一个脚本让机械臂随机运动,采集(图像,关节角度,动作)数据。
第二步,训练一个简单的模仿学习模型。用采集的数据训练一个行为克隆(Behavior Cloning)模型,输入图像和关节角度,输出动作。观察模型在仿真里的成功率。
第三步,加入域随机化。修改仿真环境,随机化光照、纹理、物体位置,重新训练模型,观察成功率的变化。
第四步,尝试VLA架构。用一个预训练的视觉语言模型作为骨干,替换掉第二步里的简单CNN,看模型是否能理解语言指令。
第五步,如果有条件,把模型部署到真实机器人上。如果没有真实机器人,可以用仿真里的新场景做测试,评估泛化能力。
这个pipeline跑通一遍,你对具身智能的核心环节就有了肌肉记忆。之后无论是读论文还是做项目,都能快速定位问题出在哪个环节。
6.3 实战阶段:选择细分方向深入
具身智能的细分方向很多,每个方向的技术栈和难点都不一样:
抓取与操作:核心难点是接触丰富的任务,比如插拔、拧转、折叠。需要深入理解力控、触觉感知、柔顺控制。
导航与移动:核心难点是动态环境下的路径规划和避障。需要深入理解SLAM、代价地图、模型预测控制。
人机交互:核心难点是理解人类意图和确保安全。需要深入理解自然语言理解、手势识别、安全监控。
多机协作:核心难点是任务分配和通信协调。需要深入理解多智能体强化学习、分布式规划。
选一个方向深入下去,做到能独立发现该方向的核心问题、能设计实验验证想法、能写出高质量的代码实现。这个深度是你在这个行业立足的根本。
7. 常见问题与排查技巧实录
7.1 模型在仿真里表现好但真机上失败
这是最高频的问题。排查思路按以下顺序进行:
| 排查项 | 检查方法 | 常见原因 |
|---|---|---|
| 视觉分布 | 对比仿真和真实的图像直方图 | 光照、白平衡、噪声差异 |
| 动作空间 | 检查仿真和真实的关节限位、速度限制 | 仿真里没有建模的物理约束 |
| 控制频率 | 确认推理频率和控制频率是否匹配 | 推理太慢导致控制延迟 |
| 物体属性 | 称量真实物体质量,测量摩擦系数 | 仿真参数与真实偏差过大 |
| 传感器延迟 | 测量从拍照到动作执行的端到端延迟 | 仿真里通常忽略延迟 |
我的经验是,80%的Sim-to-Real失败案例,问题出在视觉分布差异上。真实相机的自动曝光和自动白平衡会让图像亮度、色温随环境变化,而仿真里通常是固定光照。解决方案是在仿真里加入相机参数的随机化,模拟自动曝光和白平衡的变化。
7.2 VLA模型推理太慢怎么办
VLA模型在边缘设备上推理慢是普遍问题。几个实用的加速手段:
模型量化:把FP32的权重转成INT8,推理速度通常能提升2到3倍,精度损失在可接受范围内。注意动作头对量化更敏感,可以只量化视觉骨干。
动作分块:不要让模型每个控制步都推理一次,而是让模型一次输出未来8到16步的动作序列,然后开环执行。这样推理频率可以降低一个数量级。
异步推理:把感知和动作解耦。感知模型持续运行,更新世界状态;动作模型在需要时查询最新状态并输出动作。两者用共享内存通信。
模型蒸馏:用大模型教小模型,让小模型学会大模型的输入输出映射。蒸馏后的小模型推理速度快很多,精度损失通常在5%以内。
实测数据:一个7B参数的VLA模型,在Orin NX上FP32推理需要800ms,INT8量化后降到250ms,加上动作分块(一次推理输出16步),等效控制频率从1.25Hz提升到20Hz,已经能满足大部分操作任务的需求。
7.3 遥操作数据采集效率太低
遥操作采集是真实数据的主要来源,但效率确实是瓶颈。几个提升效率的技巧:
共享自主:不要让操作员控制所有自由度。让机器人自主完成一部分(比如保持末端执行器水平),操作员只控制关键维度(比如位置)。这样操作员可以更快地完成任务。
数据增强:采集一条轨迹后,通过图像增强(亮度、对比度、噪声)和动作扰动(在动作序列上加入小噪声)生成多条训练样本。这样一条真实轨迹可以当五条用。
任务分解:把复杂任务拆成原子技能(抓取、移动、放置),分别采集。然后训练一个技能库,执行复杂任务时按需调用。这样每个原子技能的数据可以复用到不同任务里。
主动学习:让模型先跑一遍,找出模型最不确定的状态,只在这些状态下请求人工示教。这样采集的数据都是“模型不会的”,信息密度最高。
7.4 世界模型预测不准导致规划失败
世界模型的预测误差会随着预测步长指数增长。几个缓解策略:
短步长预测:只预测未来3到5步,配合滚动时域控制。每执行一步就重新预测,用最新的观测修正误差。
集成预测:训练多个世界模型,对同一个动作序列给出多个预测结果。如果预测方差很大,说明这个动作序列的风险高,应该避免。
不确定性感知:让世界模型同时输出预测均值和方差。规划时不仅考虑预测的回报,还要考虑预测的不确定性。高不确定性的动作序列应该被惩罚。
真实数据校准:定期用真实执行的数据校准世界模型。具体做法是,让机器人在真实环境里执行世界模型规划的动作,记录实际结果,用这些数据微调世界模型。
8. 我对这个方向的一些个人判断
我在这个方向上投入了两年多时间,从最开始在仿真里跑通一个简单的抓取,到后来参与真实机器人的部署,中间踩过的坑不计其数。有几个判断,我觉得值得分享。
第一,VLA不是终点,而是起点。现在的VLA模型本质上还是在做“感知到动作的映射”,它没有真正的推理能力。未来的方向一定是VLA和世界模型的深度融合,让模型既能反射式地快速响应,又能推演式地深度思考。
第二,数据是最大的护城河。算法架构会趋同,硬件会商品化,但高质量的真实操作数据是稀缺的。谁掌握了大规模、多样化、高质量的操作数据,谁就掌握了定义下一代模型的能力。
第三,Sim-to-Real的终极方案可能是“Real-to-Sim-to-Real”。先用真实数据构建一个高保真的数字孪生,然后在数字孪生里大规模训练,再把策略迁移回真实。这个闭环一旦跑通,数据效率会有数量级的提升。
第四,安全是商业化的前提。无论模型多强,如果不能在人类身边安全运行,就无法进入家庭和公共场所。力限制、碰撞检测、急停响应这些“传统”技术,在具身智能时代反而变得更加关键。
最后分享一个我在调试中总结的小技巧:当你不知道模型为什么失败时,先把推理频率降到1Hz,用肉眼观察机器人的每一个动作。很多时候问题不在模型,而在数据预处理、坐标系变换、或者控制接口的某个细节。慢下来看,比盯着日志猜要快得多。