就在刚刚,RoboDojo榜单又更新了。
PhysicalRSI 1.0占据榜首,并取得了36.27 Score、31.38% SR,而研发团队则是港大MMLAB。
我们也跑去和PhysicalRSI的团队沟通了下,拿到了更多细节。
这是一个非常简洁且高效的自进化具身智能系统基线,让机器人根据任务改写自己的工具、代码、记忆、与技能,再由物理环境选出更有能力的“下一代”。
在官方榜单Precision维度,Astra为4%,PhysicalRSI提升明显。
具体到插钥匙,PhysicalRSI为39.33%,GPT-6 Astra、π0.5与Simate-beta均为0%;插管,PhysicalRSI为66%,三者分别为0%、3.33%与22%。π0.5本身也是PhysicalRSI能够调用的动作工具,改进来自如何组织工具、代码、记忆与技能。
此外,相较于GPT-6 Astra在RoboDojo上全量测试一次需消耗20万人民币tokens费用,PhysicalRSI 1.0仅用百分之一的成本,比GPT-6 Astra的成功率提升了40%。
- PhysicalRSI 1.0项目链接:https://mmlab.hk/research/PhysicalRSI
原文链接:中国团队提出PhysicalRSI 1.0,比GPT-6 Astra节省百倍Tokens,霸榜RoboDojo~
01 从训练动作模型,到让通用大模型直接控制机器人
OpenAI推出的通用大模型,开始在机器人评测中超过专用策略。
9 月,GPT-6 Astra在 RoboDojo上取得28.97 Score、22.48%平均成功率,超过报告比较的40个公开机器人策略。直接看图、理解指令、决定机械臂如何运动,正在成为通用大模型的一项新能力。
VLA、WAM 等路线从动作学习和物理预测入手,通用大模型则将语义理解与任务推理带入控制过程。如今,这些路线开始在同一套机器人任务上接受检验。
但GPT-6 Astra的成绩也呈现出鲜明反差:总体成绩领先,精密操作成功率却只有4%。
抓取之后怎样调整姿态、如何对准插孔、多步操作如何衔接,仍是机器人必须解决的具体问题。
而这次,港大MMLAB团队提出的Physical Recursive Self-Improvement 则是让通用模型进一步参与这些控制问题的改进。一次任务留下的经验,由此进入下一代智能体实际运行的代码与配置。
看完一次失败的执行,模型可以修改动作程序、更换工具、调整记忆与技能的调用方式,生成不同的子代智能体,再由环境中的任务表现决定保留哪个版本。
我们了解到,该方案是“System 1–2 协同自进化(System 1–2 Co-Evolution)”,让负责理解与规划的“System 2”改进负责动作执行的“System 1”,同时修改两者协作的Harness。
02 GPT-6 Astra的短板,主要在“理解之后”的控制过程
先看看GPT-6 Astra的短板在哪里。
插钥匙就是一个直观的例子。
理解“把钥匙插进锁孔”并不难,但机器人需要先抓住钥匙,调整到可用的姿态,必要时在两只手之间交接,再让钥匙与锁孔对齐。
前几步取得进展,也可能在最后的插入环节失败。
Astra的RoboDojo Precision成功率为4%,说明通用推理能力尚未充分转化为精细控制能力。
在GPT-as-policy设置中,大模型根据观察直接选择运动目标,再由底层接口转成机器人指令。
PhysicalRSI 1.0 是希望把这两层职责组织得更有效:“System 2”负责判断如何完成任务、分析哪里出错;“System 1”用技能模型、控制程序和工具完成具体动作,例如π0.5就只是其中一个可调用的动作工具。
分工之后还需要持续改进。
例如,机械臂松开衣服后的回撤路径影响了后续折叠,“System 2”就可以修改回撤程序;下一次执行时,“System 1”直接运行新程序。
与此同时,Harness也可以改变“System 2”读取哪些历史、何时检查结果、选择哪个工具。决策方式与执行能力都成为可修改、可评估、可继承的对象。
这就是“System 1–2 Co-Evolution”要解决的问题:将一次任务中的分析,落实成下一代智能体实际运行的程序与配置。环境中的后续表现,检验这次修改是否有效。
03 Self-Harness:让机器人改写自己完成任务的方法
我们了解到,PhysicalRSI 1.0 用Embodied Self-Harness实现这套协同自进化。
Harness可以理解为智能体的工作程序。
它把基模、工具、技能和记忆连接起来:看到什么信息,采用什么计划,调用哪个技能,保留哪些状态,出现偏差后怎样处理。
Self-harness 则让智能体自己修改这套工作程序。
叠衣服的版本记录给出了一个具体例子。某个候选版本改动了释放衣物后的回撤方式:下降时,记录机械臂实际经过的关节位姿;松开衣物后,沿这条路径反向返回。参数home和descent每个回合重新测量。下一代继承的是“记录路径并沿路径回撤”的方法,因此衣服位置变化后,程序仍会按当前现场重新建立状态。
Self-harness把这样的修改纳入选择过程:父代读取任务录像、动作记录和评估反馈,生成绑定不同工具、代码、记忆与技能的子代;父代与子代进入环境评估,表现更好的版本留下来,继续产生下一代。不同候选可以修改不同环节,新增代码也可能被淘汰。
这里的“适者生存”,由任务奖励或成功率具体定义。
在叠衣服的迭代中,不同版本先后探索了回撤路径、腕部对齐、目标选择和布料跟踪。
这些记录让“自进化”可以对应到具体版本、具体代码与具体动作。
04 一套简单有效的baseline,在RoboDojo中取得第一
RoboDojo仿真评测涵盖42个任务,考察泛化、精密操作、长程任务、记忆与开放能力。
基于此,PhysicalRSI 1.0设计了一套极为简单但有效的基线。
这套baseline的结构很直接:多模态基模负责理解、规划和改写harness;code-policy skills、π0.5与工具负责操作;所有动作经PhysicalAPI****进入环境。
例如,代码技能可以把数字识别、排序和抓取串起来,也可以保存被遮挡物体的位置,或安排两只手的交接顺序。
截至2026年9月28日,PhysicalRSI 1.0在官方榜单取得36.27 Score / 31.38% SR,位列第一。
Simate-beta为33.95 / 27.96%;GPT-6 Astra为28.97 / 22.48%;单独使用π0.5为11.44 / 6.93%。PhysicalRSI的成功率比Astra高8.90个百分点,比Simate-beta高3.42个百分点,约为单独使用π0.5的4.53倍。
05 从一个baseline,走向具身自进化的研究基础设施
RoboDojo 是PhysicalRSI 1.0的首个主要示例场。
但我们觉得真正的意义在于,它很有希望进一步建立具身自进化研究的基本标准:“明确智能体可以修改哪些部分,子代如何生成,环境如何评估,哪些修改能够被继承”。
每一次能力提升,都应能追溯到对应的版本、交互记录与选择过程。这也为后续成长为一套可扩展的具身自进化基础设施提供了很好的基础。