过去几年,人形机器人最容易被记住的是翻跟头、跳舞和展台上的精巧操作。到了2026年,产业关注点正在向后移动:机器人为什么能做出这个动作?动作数据从哪里来?模型怎样转化为本体能力?失败后由谁接管?数千台设备产生的数据,又如何回到下一轮训练?
一、数据:具身智能最大的瓶颈,也是最大的机会
2023年前后,具身行业对数据的焦虑还很笼统。当时连拿纸巾这类简单动作都缺数据,"不管是什么样的数据都要采"。两三年后,简单抓取的数据逐渐得到补充,缺口开始向更深处迁移:按摩、加油等专用任务,灵巧手的长程精细操作,以及需要全身协调参与的物理交互。
2026年是具身智能数据的规模化元年。据行业 estimates,今年具身智能领域的数据与评测需求出现指数级增长,整体规模已达到去年的百倍至千倍,从过去的数千小时跃升至数百万小时量级。WAIC 2026的另一个新趋势是上游数采厂商占比明显抬升——数据是具身智能的瓶颈所在,高质量数据才是拉开模型差距的真正变量。
数据的生产方式也在重写。艾欧智能把数据需求分为三段:预训练需要规模大、场景丰富的人类数据;后训练需要与具体本体、具体任务高度匹配的真机数据;机器人进入运营后,还要把现场数据持续回流。
一个关键的数字对比:单席位工作8小时,真机数据的有效时长可能不到4小时;在操作熟练、流程标准的情况下,人的第一人称数据可以达到6小时以上。这个效率差距推动人的第一人称数据迅速升温,也吸引了一批做过自动驾驶和大模型数据服务的公司进入具身赛道。
二、世界模型:机器人的"想象力"
如果说数据是具身智能的燃料,那么世界模型就是发动机。
具身智能领域对世界模型的定义正在趋于一致。智元合伙人姚卯青认为,世界模型的核心本质是能够理解物理世界运行规律的AI系统,最重要的功能是预测世界的下一个状态,而不是简单地渲染世界的下一个画面。要具备这样的能力,需要掌握四项技能:理解多模态信息并融合理解环境变化;掌握物理规律,包括动力学和空间理解;具备因果推理能力,理解作用力与物体移动的因果关系;具备长程推理能力,且不会在过程中崩坏。
它石智航创始人陈亦伦给出了一个更工程化的定义:世界模型可以非常高频地联合预测动作和状态。相较VLA而言,VLA告诉机器人下一个动作是什么;但世界模型会进一步告诉你,如果你做了这个动作,世界的状态会发生什么样的改变,甚至还会告诉你这样的改变是不是大家想要的。这就构成了经典的强化学习三要素:状态、动作和奖励。
这种方法的好处是可以灵活地结合监督学习和强化学习,让整个任务产生非常高的可完成度和成功率。
北京智源研究院发布的智源悟界·RoboBrain Orca则展示了另一个方向。当输入视频、图片、文字指令等任意多模态信息后,模型可将视觉、语言、任务意图等多元信号统一整合,自主学习物体运动规律、场景演变逻辑、动作因果关联、事件时序关系。它既能推演当前场景走向未来的演化路径,也能模拟不同条件下世界发展的多元可能性,完成从"单一输出预测"到"全局状态推演"的范式升级。
三、从展台到产线:形态被场景打散
WAIC 2026直接拿出了一整个展馆给具身机器人,相关企业数量从去年的80多家激增到了200多家。
但一个有意思的变化是:机器人的形态比去年更加丰富,但逻辑一致——按场景反推本体。一位从业者表示,凭借一款本体打天下的幻觉被订单砸碎了,"工业要轮式、家庭要人形、消费要小巧、特种要载重机甲,每家都在按场景反推本体,形态自然就被打散了"。
国家地方共建人形机器人创新中心与华为在WAIC 2026上宣告联手打造了全国首个具身智能实训场样板点。该中心首席科学家江磊表示,目前具身智能的训练大多在一个固定的场景下,这个实训场样板点希望兼顾室内环境与生产现场,构建可"进化"的具身智能全流程开发生态。
四、一点判断
具身智能正在走出"演示区"。但距离真正的规模化商用仍有距离——就连"强化学习之父"理查德·萨顿在WAIC 2026现场都指出,当前以大语言模型为代表的AI尚处于非常早期阶段。
突破具身智能落地"最后一公里",需要硬件层、模型层、部署服务层的生态协同。好消息是,行业预计今年能看到突破性进展。坏消息是,从"能看到"到"能规模化",可能还需要好几个"今年"。