最近几年,新能源车企的竞争已经不只是“车”本身,而是开始往“人形机器人”方向延伸。特斯拉、小鹏、小米、比亚迪等新造车或新能源产业链玩家,陆续展示机器人原型、投资初创公司、申请专利,甚至成立独立事业部。行业里把这件事叫做“造人”:不是字面意义上的造人,而是做人形机器人。
一个值得注意的信号是:车企造汽车的逻辑,和人形机器人的逻辑高度重合。感知、决策、执行、三电、供应链、成本控制、量产制造,这些能力几乎可以平移。但真正从原型走到量产,从实验室走到工厂和家庭,中间还有数据、算法、可靠性和安全合规等一系列问题。这也是“持续加码”和“道阻且长”并存的根本原因。
这篇文章不讨论玄学,只拆解几件事:车企为什么适合做人形机器人,具体在做什么,当前卡在哪,以及作为工程师或产业观察者,应该用哪些指标去评估一家车企的机器人项目真实进度。如果你关注具身智能、人形机器人、自动驾驶技术复用,或者正在调研车企的第二增长曲线,这篇可以直接收藏。
1. 核心能力速览
| 能力项 | 说明 |
|---|---|
| 项目本质 | 新能源车企借助自动驾驶、三电和供应链能力进入人形机器人赛道 |
| 代表玩家 | 特斯拉、小鹏、小米、比亚迪(投资生态)等,公开信息为主 |
| 核心技术栈 | 环境感知、大模型决策、运动控制、仿真训练、数据闭环 |
| 硬件门槛 | 高转矩密度关节电机、灵巧手、力传感器、车载级计算平台、电池组 |
| 复用程度 | 自动驾驶算法、电池/电机/电控、供应链管理、量产经验可复用 |
| 当前状态 | 以原型展示、小规模工厂试点为主,距离大规模量产仍有距离 |
| 核心瓶颈 | 数据获取成本高、真实场景泛化难、硬件可靠性不足、成本高、安全法规不明确 |
| 适合观察人群 | 自动驾驶工程师、具身智能研究者、机器人创业者、产业分析人员 |
从表格可以看出,车企造人的优势不在“从零发明”,而在“能力迁移”。但迁移不等于复制,尤其是运动控制和灵巧操作,和自动驾驶是两套技术体系。
2. 适用场景与使用边界
人形机器人最被看好的落地场景,短期内不在家庭,而在工业、商业服务和危险环境作业。
- 工业场景:搬运、上下料、质检、设备巡检。这些场景环境相对固定,任务重复度高,适合机器人先跑通。
- 商业服务:引导、配送、清洁。对交互能力要求高,但对操作精度要求低于工业。
- 危险作业:应急救援、高压电巡检、核工业维护。人形结构可以适配人类工作环境,减少改造产线成本。
不适合什么场景?现阶段不适合做高复杂度、强随机、非结构化的通用家庭服务。家里每个物品的位置、材质、使用方式都不同,机器人很难在短期内具备通用操作能力。
使用边界方面,有三点必须强调:
人形机器人会采集大量环境数据,包括人脸、声音、行为轨迹。涉及个人隐私的数据必须获得明确授权,不能以“训练需要”为由随意采集。
如果涉及客户工厂的产线数据、图纸、配方,要签好保密协议,明确数据归属和使用范围。
机器人在人机共融环境中作业,必须有安全停止策略、力限制和碰撞检测,不能依赖“概率性避障”来保证人身安全。
3. 车企为什么适合做人形机器人:技术映射
“车企造人”不是跨界乱入,而是存在明显的能力映射。把汽车和人形机器人放在同一张表里看,很多能力是共通的。
3.1 自动驾驶算法复用
自动驾驶的感知、预测、规划、控制链路,和人形机器人的“感知-决策-执行”链路高度相似。
- 感知层:自动驾驶使用摄像头、激光雷达、毫米波雷达感知道路环境;人形机器人使用视觉、激光雷达、触觉传感器感知周围环境。
- 决策层:自动驾驶用规则+学习做路径规划和行为决策;人形机器人需要大模型理解指令、规划任务、分解动作。
- 执行层:自动驾驶控制车辆横向和纵向运动;人形机器人需要控制全身几十个关节,协调平衡和操作。
也就是说,车企在感知融合、多模态理解、车规级计算平台上的积累,可以直接迁移到机器人上。这也是很多车企敢做“造人”的底气。
3.2 三电与供应链能力
汽车和人形机器人都是“电池+电机+电控”的组合。
人形机器人的关节电机需要高转矩密度、高响应速度和高可靠性,这与新能源汽车驱动电机、电控系统的技术方向一致。电池方面,机器人需要小型化、高能量密度的电池包,车企在电池包设计、热管理和BMS(电池管理系统)上经验充足。
更关键的是供应链管理能力。一辆车有几万个零件,车企已经具备成熟的供应商管理和成本控制体系。人形机器人的关节、传感器、结构件同样需要供应链整合,这是新进入者很难短期建立的壁垒。
3.3 数据闭环与量产经验
自动驾驶行业跑通了一个关键流程:车辆采集数据、回传、标注、训练、仿真、OTA升级。这个数据闭环非常适合复用到机器人上。
- 自动驾驶:路测数据 -> 场景库 -> 仿真 -> 模型训练 -> 实车验证 -> 新数据。
- 人形机器人:操作数据 -> 任务库 -> 仿真 -> 策略训练 -> 真机验证 -> 新数据。
量产经验同样重要。自动驾驶公司强调“车规级”,机器人行业现在也在强调“量产可靠性”。从原型到量产,要考虑良率、一致性、耐久性、维修成本。车企在这部分的经验储备,远超大多数初创机器人公司。
4. 车企“造人”的核心技术栈拆解
如果只看发布会上的机器人跳舞,会低估这件事的难度。从工程角度拆解,车企造人至少涉及五大技术栈。
4.1 感知层
人形机器人的感知比自动驾驶更复杂。自动驾驶感知的是道路参与者的位置和速度,而机器人需要感知物体形状、材质、可抓取部位、关节状态、自身姿态。
常用传感器包括:
- RGB摄像头:识别物体类别、颜色、文字。
- 深度相机:获取物体距离和三维形状。
- 激光雷达:构建环境地图和障碍物检测。
- 六维力传感器:感知关节受力和力矩。
- 触觉传感器:感知接触、滑动、压力分布。
感知层的难点在于多传感器融合和动态环境下的鲁棒性。一个动作过程中,传感器数据不断变化,机器人需要实时更新对环境和自身状态的理解。
4.2 决策层
这是当前竞争最激烈的部分。过去机器人决策靠手写状态机和规则,现在主流方向是“大模型+具身智能”。
VLA(Vision-Language-Action)模型是典型代表:输入图像、文本指令、机器人状态,输出动作序列或底层控制信号。大模型负责理解任务意图,扩散策略或强化学习负责生成具体动作。
# VLA 推理接口调用示例 # 代码仅为示例结构,实际接口需按具体模型调整 import requests url = "http://127.0.0.1:8000/vla/predict" payload = { "instruction": "将桌上的红色杯子放到托盘中", "camera_front": "data/front_frame.png", "camera_wrist": "data/wrist_frame.png", "joint_state": [0.1, 0.2, -0.3, 0.4, 0.5, -0.2], "max_steps": 120 } response = requests.post(url, json=payload, timeout=30) print(response.json()) # 预期返回: # {"action": [...], "success": True, "elapsed_ms": 85}决策层的核心问题不是“能不能生成动作”,而是“生成的动作能不能稳定完成任务”。同一个物体换个位置、换个光照、换个角度,模型能否泛化,是真正的技术分水岭。
4.3 运动控制层
这是车企最容易低估的部分。自动驾驶控制的是两轮或四轮车辆,人形机器人控制的是一条双足+双臂的多刚体系统,自由度可能超过40个。
运动控制依赖的技术包括:
- 模型预测控制(MPC):基于动力学模型做滚动优化。
- 强化学习:在仿真中训练站立、行走、抓取策略。
- 全身控制(WBC):同时协调全身所有关节,保证平衡和任务执行。
双足行走是一个经典难题。保持静态稳定已经很难,动态行走、上下坡、不规律地面、受外力干扰时保持平衡,都是控制层要解决的问题。汽车哪怕爆胎,也还是有相对稳定的动力学特性,人形机器人摔倒一次,可能直接影响硬件寿命。
4.4 仿真与数据
机器人训练数据的获取成本远高于自动驾驶。自动驾驶可以靠车队跑路收集数据,机器人操作数据只能靠真机遥操作采集,一次采集的效率和成本都很低。
解决办法是仿真训练。主流工具包括:
- MuJoCo:物理仿真引擎,适合运动控制研究。
- Isaac Sim / Isaac Lab:NVIDIA 的机器人仿真平台,支持强化学习和逼真渲染。
- 域随机化:在仿真中随机改变物理参数、光照、纹理,增强模型迁移到真实世界的稳定性。
# 仿真训练环境配置示例 # 代码仅体现参数结构,实际需按具体仿真引擎调整 config = { "physics": { "engine": "mujoco", "timestep": 0.002, "gravity": [0, 0, -9.81] }, "robot": { "urdf_path": "./robots/humanoid.urdf", "actuators": ["joint_1", "joint_2", "joint_3", "joint_4"], "initial_joint_positions": [0.0, 0.1, -0.2, 0.3] }, "task": { "name": "pick_and_place", "reward_function": "sparse_reward", "max_episode_steps": 500 }, "domain_randomization": { "friction_range": [0.5, 1.5], "mass_range": [0.8, 1.2], "lighting": True } }Sim2Real(仿真到真实迁移)是当前机器人领域最核心的工程难题之一。仿真和真实世界永远存在差距,怎么缩小这个差距,决定了一个机器人项目能否从论文走向量产。
4.5 硬件本体
硬件层面,人形机器人主要包含:
- 关节模组:电机+减速器+驱动器+编码器,是成本最高的部分。
- 灵巧手:多自由度手指,用于抓取和精细操作。
- 计算平台:运行感知和决策模型的算力单元。
- 电池与电源管理:为全身关节和计算单元供电。
- 结构件:骨架和外壳,需要轻量化和高强度。
目前,关节模组和灵巧手的成本都比较高,同时可靠性和寿命还没有经过大规模场景验证。这也是“道阻且长”最直接的体现。
5. 当前代表玩家与路线差异
从公开信息来看,车企造人主要分成三条路线。
5.1 全栈自研原型路线
代表是特斯拉的 Optimus 和小鹏的 Iron。这类玩家从硬件到软件全栈自研,目标是把人形机器人做成像智能汽车一样的产品。
特斯拉的 Optimus 从最初的概念展示,到后来的行走、抓取、叠衣服、工厂搬运,迭代速度较快。小鹏也发布了人形机器人,强调与自动驾驶同源的技术体系。小米的 CyberOne 早期以展示为主,后续逐步向真实场景推进。
这条路线的好处是技术深度可控,坏处是投入巨大、周期长。全栈自研意味着要在硬件、算法、数据、量产四个维度同时推进,任何一个环节掉队都会拖慢整体进度。
5.2 资本与生态投资路线
部分车企不直接自研机器人,而是通过投资方式进入赛道。公开信息显示,比亚迪等车企在机器人领域有投资布局,机器人初创公司也成为资本重点关注方向。
这条路线的逻辑是:不自己承担研发风险,通过投资卡位赛道,等技术和市场成熟后再深度整合。对于车企来说,这是一种成本更低、风险更小的“保持在场”策略。
5.3 产业链协同路线
还有一些车企或产业链公司,不从整机切入,而是做机器人核心零部件,比如电机、减速器、传感器、电池。
汽车供应链和机器人供应链有重叠,电机、电池、电控这些核心零部件都可以复用。这条路线的好处是离商业化更近:不卖整机,但卖零件,先赚供应链的钱。
三条路线各有优劣,短期内很难判断哪条会胜出。但从资源投入和技术壁垒来看,全栈自研路线受到的关注度最高。
6. 道阻且长:车企造人的关键瓶颈
“持续加码”意味着资本和研发资源在流入,“道阻且长”意味着真正跑通还需要解决五个关键问题。
6.1 硬件可靠性与成本
自动驾驶技术已经经过多年车规验证,但人形机器人没有。关节电机的寿命、结构件的疲劳强度、线束的耐久性、电池的循环寿命,都没有经过大规模长期场景验证。
成本问题更不能忽视。一台人形机器人原型机的成本可能接近甚至超过一辆汽车。如果要进入工厂替代人工,成本必须低于人力成本才有商业价值。硬件成本降不下来,一切商业模式都无从谈起。
6.2 训练数据获取
自动驾驶的数据可以靠车队自动采集,机器人操作数据获取要难得多。目前主要方式包括:
- 遥操作:人通过控制设备操作机器人,采集动作轨迹。
- 动捕采集:人穿戴动作捕捉设备,直接记录人体动作再映射到机器人。
- 仿真数据:在仿真环境中大规模生成数据。
遥操作采集的数据质量高,但效率低。动捕采集无法覆盖精细的指尖操作。仿真数据量足够,但存在 Sim2Real 迁移问题。数据获取效率将是长期瓶颈。
6.3 算法泛化与 Sim2Real
一个机器人能在实验室里完成抓取,不代表能在工厂里稳定完成一万次抓取。光照变化、物体位置偏移、表面材质差异、意外干扰,都会让模型失败。
当前的主流做法是“仿真训练+真机微调”:先在仿真里大规模训练策略,再在真机上做少量微调。但仿真和真实之间的差距很难完全消除,这导致很多策略从仿真到真机后成功率明显下降。
6.4 安全与法规
人形机器人一旦进入人类工作或生活场景,安全责任界定就会变得复杂。
- 机器人在工厂中造成安全事故,责任在制造商还是使用方?
- 机器人采集的数据涉及个人隐私,如何保证合规?
- 人机协作时,机器人避让人的策略达到什么标准才算“安全”?
目前这些问题还没有明确的行业标准和法规依据。车企造车有完善的碰撞安全标准,人形机器人领域的安全标准还在建立过程中。
6.5 商业模式不清晰
人形机器人的目标场景是替代重复性人力劳动,但替代成本必须低于人力成本。目前,一台人形机器人的售价和运维成本仍然偏高,能够明确盈利的场景有限。
更现实的问题是:很多工厂业务场景已经可以用机械臂、AGV等专用设备解决,人形机器人“通用”的优势在短期场景中并不明显。商业模式是否成立,需要等小批量试点数据出来后才能判断。
7. 像验收工程一样评估车企机器人进展
作为工程师或产业观察者,不能只看发布会视频,要建立一套工程化评估方法。核心是看硬指标,而不是看演示效果。
7.1 评估指标设计
可以从五个维度评估一家车企的机器人项目真实进度:
| 评估维度 | 关键指标 | 观察重点 |
|---|---|---|
| 硬件能力 | 关节自由度、负载自重比、连续运行时间 | 自由度不等于可用性,连续运行时间更能反映可靠性 |
| 任务能力 | 任务成功率、平均完成时间、最大连续成功次数 | 实验室单次成功没有意义,要看统计成功率 |
| 算法能力 | 新场景泛化次数、Sim2Real 成功率 | 看同一个模型能否在不同环境完成相同任务 |
| 量产能力 | 预估整机成本、产线规划、供应链成熟度 | 看是否具备小批量生产能力 |
| 场景落地 | 真实场景试点数量、故障率、复工率 | 试点场景越具体,可信度越高 |
7.2 任务成功率脚本示例
# 人形机器人任务成功率评估脚本 # 功能:统计一次测试中的任务成功率、平均耗时、最长连续成功次数 import json import time from collections import deque def evaluate_tasks(results): """ results: list of dict 每项包含: task_id: str success: bool duration: float """ total = len(results) success_num = sum(1 for r in results if r["success"]) success_rate = success_num / total if total else 0.0 avg_duration = sum(r["duration"] for r in results) / total if total else 0.0 max_streak = 0 current_streak = 0 for r in results: if r["success"]: current_streak += 1 max_streak = max(max_streak, current_streak) else: current_streak = 0 report = { "total_tasks": total, "success_rate": round(success_rate, 4), "avg_duration_s": round(avg_duration, 3), "max_consecutive_success": max_streak, "failed_task_ids": [r["task_id"] for r in results if not r["success"]][:20] } return report if __name__ == "__main__": test_results = [ {"task_id": "pick_001", "success": True, "duration": 3.2}, {"task_id": "pick_002", "success": True, "duration": 3.8}, {"task_id": "pick_003", "success": False, "duration": 5.0}, {"task_id": "place_001", "success": True, "duration": 2.9} ] print(json.dumps(evaluate_tasks(test_results), ensure_ascii=False, indent=2))这个脚本的核心逻辑是:不仅要看成功率,还要看平均耗时和最长连续成功次数。连续成功次数比单次成功率更能反映模型稳定性。如果模型偶尔成功一次,但无法连续成功,说明离实用还有距离。
7.3 测试任务清单示例
{ "test_suite": "工厂搬运场景基础测试", "tasks": [ { "id": "grab_01", "description": "从固定位置抓取标准纸箱", "success_criteria": "机械爪完全闭合,纸箱未滑落", "repeat_times": 20 }, { "id": "place_01", "description": "将纸箱放置到指定托盘", "success_criteria": "纸箱进入托盘区域且角度偏差小于10度", "repeat_times": 20 }, { "id": "collision_01", "description": "人靠近时立即停止", "success_criteria": "检测距离小于0.5米时停止时间小于200ms", "repeat_times": 10 }, { "id": "stability_01", "description": "连续运行2小时无故障", "success_criteria": "全程无死机、无关节过热报警", "repeat_times": 1 } ] }用这套清单去对照车企发布的测试视频,很容易判断是真进展还是摆拍。如果一家车企的机器人只在特定背景、特定光照、特定操作员下成功,说明泛化能力还不足。
8. 常见误区与排查方法
车企造人话题里有很多容易踩的认知误区。这里用“现象-原因-验证方式-结论”的方式做一个排查清单。
| 常见误区 | 产生原因 | 验证方式 | 正确结论 |
|---|---|---|---|
| 发布会原型等于量产 | 原型机由工程师精心调试,环境和任务都经过挑选 | 看是否公布连续运行时长和成功率 | 原型只证明可行性,不证明可用性 |
| 自由度越多越好 | 自由度数量是直观卖点 | 对比同自由度下的复杂操作成功率 | 自由度是上限,控制算法才是实际能力 |
| 自动驾驶算法能直接迁移到机器人 | 底层都是感知决策控制 | 对比自动驾驶模型在机器人场景上的泛化表现 | 部分复用,运动控制和灵巧操作需要重新开发 |
| 仿真训练后就能直接上真机 | 仿真数据量大、成本低 | 统计 Sim2Real 前后成功率 | 仿真只是第一步,必须有真机微调和安全验证 |
| 机器人会全面替代工厂人力 | 没有考虑成本、维护、可靠性 | 计算单台机器人的 ROI | 短期只能替代特定重复场景,长期才可能规模替代 |
| 大模型能解决所有机器人问题 | 大模型在文本和图像任务上表现强 | 测试大模型在高频动作控制上的表现 | 大模型解决任务规划,底层控制仍需专门算法 |
9. 最佳实践与建议
9.1 给车企和机器人团队的建议
先从固定场景单点突破,不要一开始就追求通用。选择一条固定的产线、一种固定的物料、一个固定的操作流程,把任务成功率做到99%以上,再考虑扩展。
建立真实的数据闭环。真机数据、仿真数据分开管理,明确数据采集标准、标注规范和版本控制。机器人训练失败时,要能回放数据,定位是感知问题、控制问题还是硬件问题。
仿真和真机并行推进。不要等仿真做完再做真机,两个团队应该并行。仿真负责快速迭代和压力测试,真机负责验证和采集真实数据。
每个测试任务都要有量化的成功标准。不能只说“能完成”,要说“在什么条件下完成多少次”。没有量化标准的测试,无法用于判断项目真实进度。
9.2 给工程师的入局建议
人形机器人是一个复杂的系统工程,不建议一上来就从头学习所有模块。建议先选择一个方向深入:
- 如果你有自动驾驶背景,可以从环境感知和多模态大模型切入。
- 如果你有控制背景,可以从运动控制和强化学习切入。
- 如果你有嵌入式背景,可以从关节模组和灵巧手方向切入。
- 如果你有数据工程背景,可以研究机器人训练数据管线。
工具链方面,MuJoCo、Isaac Sim、PyTorch 是目前最主流的入门选择。先跑通一个简单的双足平衡或机械臂抓取任务,再逐步增加复杂度。
9.3 给产业观察者的建议
判断一家车企的机器人项目是否靠谱,不要看发布会,要看三个东西:
- 有没有公布连续运行时长和任务成功率?
- 有没有真实场景的批量试点数据?
- 有没有明确的产品路线图和时间表?
如果三个都没有,很可能还处于非常早期的原型阶段。如果有了单点场景的高成功率数据,可以继续关注成本趋势和可靠性数据。
10. 总结与下一步
车企“造人”在战略上成立,在工程上仍然难。战略上,自动驾驶、三电、供应链和量产能力都是可迁移的优势;工程上,数据获取、运动控制、硬件可靠性、成本和安全法规都是绕不过去的坎。
最值得先验证的功能,不是机器人会不会走路,而是它能不能在真实场景里稳定完成重复任务。最容易踩的坑,是把实验室的单次成功当成产品可靠性。
下一步可以重点观察三件事:一是头部车企的机器人是否进入真实工厂场景批量试点;二是整机成本是否随着供应链成熟快速下降;三是VLA模型加仿真训练能否真正解决泛化问题。
这条赛道最终赢家,可能不是PPT讲得最漂亮的,而是能在一万次重复任务里把成功率做到最高、把成本降到最低的团队。