📖标题:Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
🌐来源:arXiv, 2607.12894v1
🛎️文章简介
🔸研究问题:如何构建既具备强大物理世界感知与推理能力,又满足低延迟部署需求的高效具身智能体?
🔸主要贡献:论文提出Hy-Embodied-VLM-1.0,一种基于混合专家架构的高效具身基础模型,在仅激活30亿参数的情况下,于38个基准测试中超越同类模型,实现了性能与效率的最佳平衡。
📝重点思路
🔸构建以动作为核心的能力分类体系,将具身智能划分为动作相关状态理解、动作转换推理、序列与自适应推理三个递进维度,以此指导数据构建与评估。
🔸设计系统化的数据流水线,涵盖预训练、监督微调及强化学习阶段,引入深度推理、社会交互、轨迹监督及失败感知等高质量数据,强化模型对物理因果与长程任务的理解。
🔸采用Hy3-A3B语言主干与Hy-ViT2视觉编码器,结合混合专家架构,在保持约300亿总参数容量的同时,每次前向传播仅激活30亿参数,显著提升推理效率。
🔸实施自进化后训练循环,利用强化学习激发推理能力,通过拒绝采样合成高质量思维链数据并重新训练模型,最后进行奖励专项微调以融合连续与离散任务的优势。
🔎分析总结
🔸在38个涵盖感知、理解与推理的基准测试中,该模型在19项上取得最佳成绩,平均性能比前代模型提升8.4%,优于Qwen3.6-A3B和Cosmos 3等强劲竞品。
🔸尽管激活参数量仅为前代大模型的十分之一,其整体性能却与之相当,证明了混合专家架构在具身场景下能有效兼顾模型容量与计算成本。
🔸在视觉语言导航任务中表现出色,不仅在指令跟随导航中达到最先进水平,还在零样本物体目标导航中展现出强大的空间记忆与长程规划能力。
🔸定性分析显示,模型能准确识别物理属性、推断动作后果,并在执行失败时进行诊断与恢复,体现了从静态感知到动态适应的完整具身智能闭环。
💡个人观点
论文打破了传统视觉语言模型仅关注静态感知的局限,建立了从状态理解到长程自适应的动作中心能力框架。