2025年刚开年,具身智能圈就扔出了一颗深水炸弹——山姆·奥特曼在一次公开访谈里,首次明确确认OpenAI将自研人形机器人。注意他的措辞,不是“投资一个团队”,不是“联合开发”,而是“自己做一整个人形机器人”。这事放在三年前不敢想,放在一年前也是争议巨大,但放在今天,几乎成了顺理成章的一步。
我先说结论:OpenAI下场做机器人,表面上看是业务边界扩张,实际上是在给自己寻找“AGI的物理出口”。ChatGPT再强,也困在文本和图像里,而一个能看、能听、能动手的实体,才是大模型真正进入物理世界的最短路径。这篇内容我不想只做新闻复述,我会从技术路线、行业格局、个人机会三个角度把这件事拆透,适合机器人方向的从业者、大模型应用开发者,以及所有正在观望具身智能赛道的朋友。读完你至少能明白:OpenAI到底在赌什么,这条赛道接下来会怎么走,以及你自己该怎么接住这波机会。
1. 为什么OpenAI突然“下场”造机器人
1.1 从幕后投资到亲自上手,态度转变背后有迹可循
过去几年,OpenAI在机器人领域一直走的是“投资+模型输出”路线。公开报道里能看到的就有Figure、1X、Physical Intelligence等多家公司,OpenAI要么出钱,要么提供GPT系列模型能力,让别人的本体搭载自己的“大脑”。这条路线的好处是轻资产,风险和成本都压在本体厂商身上,OpenAI只需要做好模型就行。但它有一个致命问题:模型能力再好,数据闭环不在自己手里,关键技术路线受制于人。
转折点也很明显。2024年底到2025年初,Figure公开表态在自研端到端AI系统,不再依赖外部大模型;甚至还有“某本体公司逐步减少OpenAI依赖”的说法在圈内流传。与此同时,OpenAI的内部招聘动向也很敏感——机器人机械设计、电子工程、系统集成、数据采集等岗位一口气放出好几个,这绝不是做一个API能解释的。奥特曼这次公开确认,只是把已经跑了一段的路摆到台面上。
用商业逻辑理解这件事,其实特别简单:当你发现你送出去的“大脑”正在给别人做嫁衣,而对方还想偷偷换脑子的时候,最稳妥的办法就是自己也长出一具身体。自研意味着从硬件设计到软件训练,所有环节都在自己掌控下推进,不会再出现“模型适配度不够”“数据舍不得给”这类扯皮问题。奥特曼的公开表态,等于把OpenAI过去几年反复摇摆的答案钉死了。
1.2 OpenAI造机器人,到底图什么
很多人第一反应是“OpenAI终于要跟特斯拉抢生意了”,但把账算细一点,你会发现它图的根本不是卖一台机器人那么简单。
第一层是数据。当前大模型最缺的不是文本,而是物理世界的交互数据。文本数据快被挖完了,视频数据也差不多,但机器人轨迹数据——也就是机械臂怎么动、手指怎么捏、人怎么走过去拿杯子——这些数据目前极度稀缺,而且每一小时都真实反映物理世界的因果关系。谁掌握海量真实的机器人操作数据,谁就能训练出更接近通用物理理解的模型。OpenAI如果继续只做软件,就只能跟人买数据或合作采集,这等于把命脉交给别人。自研人形机器人,本质上是自己搞了一条高质量数据生产线。
第二层是战略卡位。AGI要真正进入现实,不可能只靠对话框。无论是替你取快递、帮你做家务,还是在工厂里完成装配,都需要一个物理载体。谁先把这个载体跑通,谁就定义了下一代人机交互入口。OpenAI错过社交、硬件终端这些入口之后,不会再轻易放过机器人这个入口。
第三层是模型边界验证。当前多模态模型对物理世界的理解还停留在“看图说话”的层面。机器人是天然的验证场,模型必须在真实环境里连续推理、纠错、规划,一次失误就是一次崩溃。这个过程逼着模型从“会聊天”走向“会干活”,对OpenAI整体模型能力的提升是全方位的。
1.3 为什么偏偏是人形,不是机械臂或轮式机器人
有人会问,做机械臂或者轮式底盘成本低、技术成熟,为什么非要啃人形这个硬骨头。我的理解是:通用性的天花板完全不同。
机械臂适合固定工位,轮式机器人适合平地和导航,但它们都只能覆盖特定场景。人形机器人最大的优势在于,整个世界的基础设施——楼梯、门把手、椅子、工具——都是按照人体工学设计的。人形意味着它天然能适配仓库、家庭、车间、医院这些场景,几乎不需要对环境做任何改造。这一点放在规模化部署语境里,价值就太大了:你不需要为了一个机器人重新改造整座房子或整条产线。
还有一个层面是交互体验。LangChain那类文本工具不需要身体,但未来机器人要和普通人协作,人形外观会带来更自然的沟通预期。就像老人院里的护理机器人,若有手臂和表情,心理接受度会显著高于一个扫地机器人。当然,人形形态的运动控制、功耗、成本全是地狱级难题,OpenAI敢选择这条最难的路,也侧面说明它不是想快速卖货,而是想在技术栈最深处建立起别人短时间追不上的壁垒。
2. 一台能干活的人形机器人,核心技术在拼什么
2.1 大脑、小脑的分工,决定了机器人“聪明”的上限
很多非技术读者会以为人形机器人就是“大模型+”一个金属身体,插上电就能干活。实际上,一个能稳定工作的机器人系统,至少要在两个层面同时发力。
“大脑”负责理解语言、规划任务、识别物体。比如你说“帮我把桌上那个红色马克杯拿来”,大脑要做的事情是:听懂指令、识别杯子位置、规划路径、判断抓取姿态。这套逻辑现在主要靠多模态大模型来完成,也就是视觉语言模型加推理规划。“小脑”负责执行层面的运动控制:走路不摔、伸手不抖、抓握不滑。小脑部分现在更依赖强化学习、模型预测控制这类底层算法,它们直接输出关节扭矩和轨迹。
传统机器人公司更擅长小脑,模型公司更擅长大脑。但真正好用的机器人必须把两者缝成一个整体。OpenAI自研的意义,就是要把大脑和小脑放到同一个优化目标里去训练,而不是像以前那样“大脑输出一个坐标,小脑机械执行”。只有联合优化,才能实现“看到杯子在倾斜的时候就提前补偿用力”这种自然到像人一样的操作。
2.2 VLA:把“看”和“说”直接变成“做”
最近这个圈子里高频出现的词叫VLA,全称是Vision-Language-Action,视觉-语言-动作模型。你可以把它理解成一个“端到端”的机器人控制大模型:输入是摄像头画面和人类指令,输出直接是机械臂或关节的动作序列,中间不再依赖一堆手写的规则模块。
过去机器人的经典做法是分模块级联:先视觉识别,再语义理解,再路径规划,再运动控制,每个模块单独调,累积误差巨大。VLA的做法是让Transformer去吃海量“图像+指令+动作”配对数据,自己学习从观察直接到动作的映射。谷歌的RT系列、Physical Intelligence的π0走的都是这个方向,OpenAI要做人形机器人,几乎绕不开VLA这条路线。
不过VLA目前的难点也很实在。一是动作表示:动作既可以离散成token像文字一样生成,也可以预测连续值,两种方案在精度和数据效率上差异很大。二是长程任务:现在VLA能做一个“拿杯子”动作,但要连续完成“打开冰箱、拿出鸡蛋、放到灶台、开火”这种长序列,仍然会崩。三是数据量:VLA是标准的“喂多少出多少”的模型,缺数据就是缺智能,而且机器人数据的维度又远高于文本,采集成本极高。
2.3 数据才是终极壁垒,遥操作、仿真与数据飞轮
聊到数据,就得展开讲讲机器人的数据从哪来。目前主流是三条路。
第一条是遥操作采集。人操作员戴上动作捕捉设备,远程控制机器人做任务,整个轨迹数据被完整录制下来。这套方式数据质量最高、最接近人的操作习惯,但人力成本极大,一个人一天也就采几百条轨迹,而且很难规模化。第二条是仿真训练。在MuJoCo、Isaac Lab这类模拟环境里,让机器人自己疯狂做任务,相当于让它在虚拟世界里跑几百万次“抓杯子”,然后再把策略迁移到真实世界。仿真便宜且量大,但要解决“仿真到现实”的鸿沟,模型在模拟器里学会的动作一上真机就变形甚至翻车。第三条是数据飞轮。机器人部署到真实环境后,一边干活一边回传失败案例和新场景数据,自动变成下一代训练集。这条路最终能降低数据成本,但只有先卖出去、部署出去才能形成。
OpenAI自研人形机器人,最重要的其实是把第三条路抓在自己手里。它不缺资金、不缺算力、不缺模型能力,缺的是真实世界的数据入口。自己造机器人,就拥有了一个全天候工作的数据采集终端网络。长期看,这才是远比卖硬件更有想象力的生意。
3. OpenAI入场,整个机器人生态都得重新洗牌
3.1 原来靠OpenAI大脑做事的本体厂商,处境最微妙
OpenAI宣布自研之前,市面上有不少机器人公司的主打卖点是“接入OpenAI模型”,等于把“聪明的大脑”作为一个核心亮点。现在OpenAI自己也下场了,这些公司就相当尴尬:继续用OpenAI模型,是在给对手喂数据;不用OpenAI模型,又可能要从头训练大模型,研发成本陡然上升。
最理性的选择是转向开源模型或自研模型。Figure已经这么做了,更多中小型机器人公司大概率也会跟进。这会带火一波开源VLA和开源多模态模型的生态,比如让机器人团队用开源模型做任务规划和控制,反而会让模型生态更加百花齐放。对OpenAI来说,虽然会失去一部分模型授权生意,但它本来就不靠这个盈利,这笔账完全划得来。
短期里有一类公司反而会因此受益,就是专门的机器人AI模型供应商,比如Physical Intelligence这类独立公司。它们既不绑定OpenAI,也不做本体硬件,专门给各家机器人厂商提供AI方案,随着OpenAI和本体厂商的矛盾加深,它们的议价权反而会上涨。当然,这也意味着它们很可能成为OpenAI收购名单上的优先目标。
3.2 供应链被推到前台,硬件产能成为卡点
在软件圈混久了,很容易低估硬件制造的难度。一台人形机器人身上的核心零部件,比如行星滚柱丝杠、无框力矩电机、谐波减速器、六维力矩传感器、灵巧手里的微型驱动器和触觉传感器,每一项都是高精度制造工艺,产能爬坡慢、良品率提升难。
OpenAI自研消息一出,最开心的其实是产业链上游。整机需求的确定性提高,意味着这些零部件厂商的订单预期会水涨船高。供应链的逻辑很简单:无论谁最终做出爆款人形机器人,只要这个品类起来了,上游关键零件的出货量就一定会爆发。这也是为什么最近一两个月,很多资本开始密集看机器人核心零部件项目,本质上是在赌“量产放量”早周期。
对OpenAI来说,硬件供应链是它最大的短板。强如特斯拉,在Optimus的量产过程中也反复吃零部件的亏。OpenAI作为软件基因很重的公司,要么自建供应链团队硬啃,要么通过与多家零件厂深度绑定的方式借力。这个环节一旦卡住,再强的模型能力也无法变成产品,所以实际情况可能会比乐观预测慢不少。
3.3 创业团队的机会:别硬拼整机,去做数据与场景
每次有巨头入场,都会有人焦虑:是不是没机会了?我的看法恰恰相反,大厂做整机,反而给中小团队腾出了更清晰的生态位。
第一条路是做数据服务。大量机器人公司会缺数据,尤其是真实场景的操作数据。如果你能在特定场景里高效采集、清洗、标注机器人轨迹数据,并且形成规模化交付能力,你就成了所有模型和本体厂商都需要的外包资源。第二条路是做场景集成。工厂巡检、物流分拣、养老护理、零售导览,这些行业都不是靠一台裸机就能落地的,需要有人做需求分析、方案设计、部署调试和售后运维。这些脏活累活巨头反而做不细,恰好是中小团队的收入来源。第三条路是做垂直模型或中间件。开模型底盘+特定行业的增量数据训练,做成“懂这个行业的机器人解决方案”,这是OpenAI短时间不会亲自去碰的角落。
说白了,人形机器人是一个超级大赛道,不会只有一家通吃。大厂抢的是平台和入口,创业团队赚的是密度和深度,只要找准一个具体场景死磕下去,机会并不少。
4. 新闻落地到工程,普通人该怎么接住这波机会
4.1 机器人方向开发者:从一条VLA小链路开始
如果你有编程背景,哪怕没有机器人硬件,也完全可以先把VLA链路跑通。最快速的路径是:用开源VLA权重加一台便宜的模拟机械臂环境,在小规模任务上做行为克隆训练。
大致的流程是这样:
- 搭建仿真环境,比如MuJoCo或Isaac Lab,里面放一个机械臂和几个方块。
- 定义动作空间,通常是末端位置加夹爪开合,或直接输出关节角。
- 用遥操作或脚本控制的方式,自动化生成几千条“图像+指令+动作”的轨迹数据。
- 用开源VLA模型或两阶段训练方式进行行为克隆,让模型学会从图像和指令输出动作。
- 在未见过的新位置做泛化测试,记录成功率。
# 概念示意:VLA 模型输入与输出(具体接口以所用模型文档为准) observation = { "image": camera_frame, # 当前相机画面 (H, W, 3) "instruction": "把红色方块放到篮子里", "state": joint_angles # 当前关节角度,假设是7自由度机械臂 } action = vla_model.predict(observation) # 返回动作可以是末端轨迹点,也可以是目标关节角这里最关键的“第一性原理”是:VLA不会天生就会做任务,它需要大量行为示范才能像“肌肉记忆”一样把指令转成动作。刚开始跑通流程比追求精度重要,你会很快理解模型的泛化极限在哪、数据质量如何影响动作质量,这些体感是看再多论文也得不到的。
4.2 大模型方向开发者:先给机器人装一个“任务大脑”
如果你没有机器人硬件基础,只熟悉大模型应用开发,可以从任务规划的“大脑”切入。核心思想用一句话概括:让大模型负责“决定做什么”,把“具体怎么做”交给底层运动模块。
架构大致是这样:接收用户自然语言,大模型把它分解成一串可执行的子任务;然后调用现成的机器人能力模块,比如移动到某个坐标、抓取某个物体、执行某个动作;每执行一步再调取环境反馈,修正后续计划。这个过程中,大模型相当于调度员,不是每个动作都直接出扭矩,而是做高层决策。
# 概念示意:任务规划模型的结构化输出 system_prompt = """ 你将获得一句用户指令和一些可用技能。请将指令拆解为有序技能调用列表,输出严格的JSON。 可用技能: navigate_to(目标位置), grasp(物体名称), place(放置位置), handover(对象) """ # 用户输入: “从桌上递水杯给我” # 模型输出: # [ # {"skill": "navigate_to", "target": "桌子"}, # {"skill": "grasp", "object": "水杯"}, # {"skill": "navigate_to", "target": "用户面前"}, # {"skill": "handover", "object": "水杯"} # ]这里有一条必须强调的安全红线:不要让大模型直接控制机械臂末端,更不要让模型直接发关节扭矩指令。正确做法是模型只输出高层意图,由一层确定性的安全策略去校验后,再触发运动指令。否则大模型的幻觉,哪怕只有千分之一的概率,也会导致真实世界的危险。这是我在跑机器人Demo时踩过的坑,永远别相信模型的每一步判断都正确。
如果你连代码也不想写,还可以去做机器人语料整理。比如把特定场景的设备说明书、故障知识、操作手册整理成RAG知识库,让机器人能回答“这台设备报警了是什么意思”这类问题。这种工作门槛低、需求旺,而且不管模型厂商如何换,知识库资产都会沉淀下来。
4.3 非技术出身:场景、数据、产品化三条路
没有技术背景的人,听到“OpenAI自研机器人”可能觉得跟自己没关系。其实这波浪潮里,最缺的往往不是工程师,而是“知道怎么把机器人用起来”的人。
场景这条线,核心是找到愿意付费的具体需求。我认识一个做工业巡检的朋友,他对机器人技术细节一窍不通,但他非常清楚锌冶炼厂里需要检查哪些仪表、什么温度区间算异常、数据日志怎么录。他只需要把需求文档写清楚,对接技术团队,就能做集成商门槛不低的生意。这类“懂行业+愿意干活”的角色,在大厂标准化产品落地前,价值非常大。
数据这条线,是所有模型公司都绕不开的。现在要做机器人操作数据采集,就需要大量人做标注、校验、回放,比如判断一次抓取动作是否成功、一帧图像里哪个区域是目标物体。这些工作不需要太深的技术背景,但需要细心和耐心,收入也在随行业水涨船高。
产品化这条线,适合有产品思维的人。把一台“啥都能干”的人形机器人,定义成某个场景里“能干好”的专用设备,本身就是一门学问。谁先把功能边界、验收标准、失败兜底策略说清楚,谁就能拿到落地合同。
5. 热闹背后,我看到的冷风险和长期变量
5.1 硬件制造是慢生意,OpenAI也绕不过供应链
OpenAI在软件上再强,也要面对一个现实:造硬件不是训模型,模型迭代可以几周一个版本,硬件从设计到量产往往按年计。尤其是人形机器人这种复杂机械系统,一颗螺丝的材质选错都可能导致整机寿命缩水。
供应链的第二个问题在良率和成本。目前一台人形机器人原型机的物料成本还很高,传感器、关节执行器、灵巧手这些部件,单是BOM就能压垮多数初创公司。哪怕OpenAI资金充裕,也不能凭钱变出产能,它需要跟大量零部件供应商磨合、测试、迭代。所以我的判断是,OpenAI自研机器人的真正落地周期大概率比宣传的“即将发布”要长,可能需要两三年才看到有意义的原型或小批量产品。
5.2 泛化、幻觉与安全,端口到端还远不能盲目上车
技术层面,最让人不放心的还是泛化和安全性。VLA模型在实验室里表现亮眼,一旦放到真实的家庭或工厂,光照、物体位置、干扰因素全变了,成功率断崖式下降是家常便饭。再加上大模型本身存在幻觉,机器人端到端控制一旦把幻觉“执行”出来,就可能造成真实损坏。
所以靠谱的产品一定会做分层安全设计。比如在低层加物理约束:力矩限制、速度限制、机械急停、安全PLC;在高层加逻辑校验:机器人准备执行动作前,先由另一套规则系统评估动作是否安全。这也是我特别不建议工程师在真机上直接跑端到端模型的原因,只适合在仿真或安全隔离区里验证。真正的商用产品,必须有一个不依赖大模型的硬性安全兜底,这是所有想做机器人落地的人都要记住的底线。
5.3 OpenAI这一步给从业者的真正信号
把目光从新闻热度上收回来,OpenAI自研人形机器人这个决定,更大的意义在于:它向整个科技和工业界释放了一个明确信号——大模型的下一个主战场,一定在物理世界里。
对我个人而言,这事最有价值的启发不是“某家公司又要引领什么了”,而是“能动手的AI终于要成为主流方向”。接下来几年,最吃香的人一定是能同时理解大模型和物理系统的人。他们未必需要把两边都做到极致,但能在大脑和小脑之间架起桥梁,用模型能力驱动真实设备完成真实任务,这种稀缺能力会随着这波浪潮被快速放大。
所以如果你现在正好站在AI和机器人的交叉路口,别被“技术门槛太高”吓退。从仿真环境、从开源模型、从数据标注开始,哪怕只跑通一个很小很小的动作,也比一万句“未来已来”有价值。我自己就是这么一路试过来的,很多东西一开始根本不完美,但做起来之后,路才会越走越清晰。