news 2026/9/30 12:14:56

中国团队提出PhysicalRSI 1.0,比GPT-6 Astra节省百倍Tokens,霸榜RoboDojo~

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
中国团队提出PhysicalRSI 1.0,比GPT-6 Astra节省百倍Tokens,霸榜RoboDojo~

就在刚刚,RoboDojo榜单又更新了。

PhysicalRSI 1.0占据榜首,并取得了36.27 Score、31.38% SR,而研发团队则是港大MMLAB。

我们也跑去和PhysicalRSI的团队沟通了下,拿到了更多细节。

这是一个非常简洁且高效的自进化具身智能系统基线,让机器人根据任务改写自己的工具、代码、记忆、与技能,再由物理环境选出更有能力的“下一代”。

在官方榜单Precision维度,Astra为4%,PhysicalRSI提升明显。

具体到插钥匙,PhysicalRSI为39.33%,GPT-6 Astra、π0.5与Simate-beta均为0%;插管,PhysicalRSI为66%,三者分别为0%、3.33%与22%。π0.5本身也是PhysicalRSI能够调用的动作工具,改进来自如何组织工具、代码、记忆与技能。

此外,相较于GPT-6 Astra在RoboDojo上全量测试一次需消耗20万人民币tokens费用,PhysicalRSI 1.0仅用百分之一的成本,比GPT-6 Astra的成功率提升了40%。

  • PhysicalRSI 1.0项目链接:https://mmlab.hk/research/PhysicalRSI

原文链接:中国团队提出PhysicalRSI 1.0,比GPT-6 Astra节省百倍Tokens,霸榜RoboDojo~

01 从训练动作模型,到让通用大模型直接控制机器人

OpenAI推出的通用大模型,开始在机器人评测中超过专用策略。

9 月,GPT-6 Astra在 RoboDojo上取得28.97 Score、22.48%平均成功率,超过报告比较的40个公开机器人策略。直接看图、理解指令、决定机械臂如何运动,正在成为通用大模型的一项新能力。

VLA、WAM 等路线从动作学习和物理预测入手,通用大模型则将语义理解与任务推理带入控制过程。如今,这些路线开始在同一套机器人任务上接受检验。

但GPT-6 Astra的成绩也呈现出鲜明反差:总体成绩领先,精密操作成功率却只有4%。

抓取之后怎样调整姿态、如何对准插孔、多步操作如何衔接,仍是机器人必须解决的具体问题。

而这次,港大MMLAB团队提出的Physical Recursive Self-Improvement 则是让通用模型进一步参与这些控制问题的改进。一次任务留下的经验,由此进入下一代智能体实际运行的代码与配置。

看完一次失败的执行,模型可以修改动作程序、更换工具、调整记忆与技能的调用方式,生成不同的子代智能体,再由环境中的任务表现决定保留哪个版本。

我们了解到,该方案是“System 1–2 协同自进化(System 1–2 Co-Evolution)”,让负责理解与规划的“System 2”改进负责动作执行的“System 1”,同时修改两者协作的Harness。

02 GPT-6 Astra的短板,主要在“理解之后”的控制过程

先看看GPT-6 Astra的短板在哪里。

插钥匙就是一个直观的例子。

理解“把钥匙插进锁孔”并不难,但机器人需要先抓住钥匙,调整到可用的姿态,必要时在两只手之间交接,再让钥匙与锁孔对齐。

前几步取得进展,也可能在最后的插入环节失败。

Astra的RoboDojo Precision成功率为4%,说明通用推理能力尚未充分转化为精细控制能力。

在GPT-as-policy设置中,大模型根据观察直接选择运动目标,再由底层接口转成机器人指令。

PhysicalRSI 1.0 是希望把这两层职责组织得更有效:“System 2”负责判断如何完成任务、分析哪里出错;“System 1”用技能模型、控制程序和工具完成具体动作,例如π0.5就只是其中一个可调用的动作工具。

分工之后还需要持续改进。

例如,机械臂松开衣服后的回撤路径影响了后续折叠,“System 2”就可以修改回撤程序;下一次执行时,“System 1”直接运行新程序。

与此同时,Harness也可以改变“System 2”读取哪些历史、何时检查结果、选择哪个工具。决策方式与执行能力都成为可修改、可评估、可继承的对象。

这就是“System 1–2 Co-Evolution”要解决的问题:将一次任务中的分析,落实成下一代智能体实际运行的程序与配置。环境中的后续表现,检验这次修改是否有效。

03 Self-Harness:让机器人改写自己完成任务的方法

我们了解到,PhysicalRSI 1.0 用Embodied Self-Harness实现这套协同自进化。

Harness可以理解为智能体的工作程序。

它把基模、工具、技能和记忆连接起来:看到什么信息,采用什么计划,调用哪个技能,保留哪些状态,出现偏差后怎样处理。

Self-harness 则让智能体自己修改这套工作程序。

叠衣服的版本记录给出了一个具体例子。某个候选版本改动了释放衣物后的回撤方式:下降时,记录机械臂实际经过的关节位姿;松开衣物后,沿这条路径反向返回。参数home和descent每个回合重新测量。下一代继承的是“记录路径并沿路径回撤”的方法,因此衣服位置变化后,程序仍会按当前现场重新建立状态。

Self-harness把这样的修改纳入选择过程:父代读取任务录像、动作记录和评估反馈,生成绑定不同工具、代码、记忆与技能的子代;父代与子代进入环境评估,表现更好的版本留下来,继续产生下一代。不同候选可以修改不同环节,新增代码也可能被淘汰。

这里的“适者生存”,由任务奖励或成功率具体定义。

在叠衣服的迭代中,不同版本先后探索了回撤路径、腕部对齐、目标选择和布料跟踪。

这些记录让“自进化”可以对应到具体版本、具体代码与具体动作。

04 一套简单有效的baseline,在RoboDojo中取得第一

RoboDojo仿真评测涵盖42个任务,考察泛化、精密操作、长程任务、记忆与开放能力。

基于此,PhysicalRSI 1.0设计了一套极为简单但有效的基线。

这套baseline的结构很直接:多模态基模负责理解、规划和改写harness;code-policy skills、π0.5与工具负责操作;所有动作经PhysicalAPI****进入环境。

例如,代码技能可以把数字识别、排序和抓取串起来,也可以保存被遮挡物体的位置,或安排两只手的交接顺序。

截至2026年9月28日,PhysicalRSI 1.0在官方榜单取得36.27 Score / 31.38% SR,位列第一。

Simate-beta为33.95 / 27.96%;GPT-6 Astra为28.97 / 22.48%;单独使用π0.5为11.44 / 6.93%。PhysicalRSI的成功率比Astra高8.90个百分点,比Simate-beta高3.42个百分点,约为单独使用π0.5的4.53倍。

05 从一个baseline,走向具身自进化的研究基础设施

RoboDojo 是PhysicalRSI 1.0的首个主要示例场。

但我们觉得真正的意义在于,它很有希望进一步建立具身自进化研究的基本标准:“明确智能体可以修改哪些部分,子代如何生成,环境如何评估,哪些修改能够被继承”。

每一次能力提升,都应能追溯到对应的版本、交互记录与选择过程。这也为后续成长为一套可扩展的具身自进化基础设施提供了很好的基础。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/30 12:13:51

用CNN做OFDM频谱感知:从数据集构建到模型部署的完整实践

简介:这是基于卷积神经网络的OFDM频谱感知方法研究论文PDF,面向认知无线电、无线通信与深度学习交叉领域的研究者及工程技术人员,聚焦如何在低信噪比环境下高效利用CNN实现OFDM信号频谱感知。资源共1个PDF文件,压缩包大小2.04MB&a…

作者头像 李华
网站建设 2026/9/30 12:11:43

企业微信API开发:消息收发与素材上传全链路工程实践

官方文档:平台介绍 - QiWe API|企微 API 开发文档 一、业务痛点与技术背景 SCRM 日常:文本接待、发报价单 PDF、发产品图、群公告。高频误区: 把图片 URL 塞进 /msg/sendText → 对端只看到字符串 未区分 userId / roomId → 发…

作者头像 李华
网站建设 2026/9/30 12:11:41

基于SpringBoot与Hadoop的健康饮食推荐系统实战

1. 项目概述与核心价值拆解 1.1 这个项目到底解决什么问题 做毕设选题目,最怕的不是题目难,而是题目又老又空。如果去知网翻一翻近三年的本科毕业论文,会发现“基于XX的XX管理系统”这一类的选题占了大半壁江山,导师看了都审美疲…

作者头像 李华
网站建设 2026/9/30 12:11:17

《烟烬见中华》文化书装帧设计复盘:软封硬壳与文本内核的融合

做文化类文创书这些年,我见过太多“标题很美但内里撑不起来”的项目,拿到《烟烬见中华》这套选题的时候,第一反应是它的题眼藏得够深——烟、烬、中华三个词叠在一起,既有消逝的怅惘,又有重生的厚重。作者墨澜逸客配的…

作者头像 李华
网站建设 2026/9/30 12:11:01

2022-2026全球AI大模型进化全纪录

从2022年生成式AI爆发,到2026年多模态、智能体、超大规模模型全面落地,全球头部AI厂商完成数轮技术革新与产品迭代。 本文全网最全、时间最新、数据精准,整合OpenAI、Anthropic、Google、xAI、Meta及国内主流大厂大模型迭代历程,清…

作者头像 李华
网站建设 2026/9/30 12:08:34

IPD落地推不动?产品线模式才是组织底座与投资决策关键

最近连续被好几家正在推进IPD的企业问到同一个问题:流程文件、评审模板、项目立项标准全都搭起来了,管理层也很重视,可产品开发项目还是推不动,跨部门沟通依旧靠刷脸,该打的仗打不赢。聊到后面,基本都会落在…

作者头像 李华