news 2026/8/29 2:34:09

【论文自动阅读】VLM4VLA: REVISITING VISION-LANGUAGE-MODELS IN VISION-LANGUAGE-ACTION MODELS

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【论文自动阅读】VLM4VLA: REVISITING VISION-LANGUAGE-MODELS IN VISION-LANGUAGE-ACTION MODELS

快速了解部分

基础信息(英文)

  1. 题目: VLM4VLA: REVISITING VISION-LANGUAGE-MODELS IN VISION-LANGUAGE-ACTION MODELS
  2. 时间年月: 2025年(根据参考文献推断,文中提及当前时间为2026年,该文为近期研究)
  3. 机构名: Institute for Interdisciplinary Information Sciences, Tsinghua University; Qwen Team, Alibaba Inc.
  4. 3个英文关键词: Vision-Language-Action (VLA); Vision-Language Models (VLM); Embodied AI

1句话通俗总结本文干了什么事情
本文建立了一个标准化的测试框架(VLM4VLA),用来搞清楚什么样的视觉语言大模型(VLM)底座最适合用来做机器人的大脑(VLA),以及为什么现有的VLM在控制机器人时表现不佳。

研究痛点:现有研究不足 / 要解决的具体问题
目前大家虽然都在用预训练的视觉语言模型(VLM)来做机器人动作模型(VLA),但很少有人系统性地研究:到底什么样的VLM底座能力能转化为机器人干活的能力?大家普遍假设VLM越强,机器人越强,但这其实是个误区。

核心方法:关键技术、模型或研究设计(简要)
提出了VLM4VLA管道:设计了一个极简的插件(仅增加<1%的参数),把各种通用的VLM模型转换成能控制机器人的VLA策略模型,从而在公平的条件下对比不同VLM底座的性能。

深入了解部分

相比前人创新在哪里

  1. 公平对比视角:以前的研究往往因为网络结构不同(如Diffusion模型 vs MLP)导致无法公平比较底座的好坏,本文用最简单的MLP头实现了跨架构的公平对比。
  2. 反直觉的发现:打破了“VLM通用能力越强,机器人表现越好”的迷思,发现VLM的视觉编码器是瓶颈,且专门针对具身任务微调VLM(如做视觉问答)并不一定能提高机器人控制性能。

解决方法/算法的通俗解释
想象你要教不同的人(VLM底座)学会看图做家务。

  • 以前的方法:给每个人配不同的复杂教学大纲(复杂的策略网络),导致分不清是人聪明还是大纲好。
  • 本文的方法:给所有人发一本完全一样的、最简单的操作手册(VLM4VLA插件),然后看谁学得快。这个手册只教他们如何把看到的画面和听到的指令翻译成具体的动作坐标。

解决方法的具体做法

  1. 插入动作查询Token:在VLM的输入序列最后加一个可学习的“动作查询标记”(Action Query Token)。
  2. MLP解码:取这个标记对应的输出特征,通过一个简单的两层MLP网络(多层感知机),直接预测机器人的动作(位置和状态)。
  3. 全参数微调:在训练时,不仅微调新加的MLP,也会微调VLM底座的所有参数(包括视觉和语言部分),以测试其真实潜力。

基于前人的哪些方法

  • 基于Vision-Language Models (VLMs)的预训练知识(如Qwen2.5-VL, Paligemma, Kosmos等)。
  • 借鉴了RT-2OpenVLA等将视觉语言模型用于机器人控制的思想,但简化了其复杂的策略头设计。

实验设置、数据、评估方式

  • 模型底座:测试了9种主流VLM(如Qwen系列、Paligemma、Kosmos-2等)。
  • 数据集:使用了3个基准数据集进行训练和评估:CALVIN(模拟桌面操作,测试泛化性)、SimplerEnv Bridge(真实数据训练,模拟环境测试)、Libero-Long(长程复杂任务)。
  • 评估方式:计算任务完成的成功率。对比了从零训练、冻结部分参数微调、全参数微调等多种情况。

提到的同类工作

  • OpenVLA:基于Llama-2的开源VLA模型。
  • pi0:基于Paligemma-1的流模型(Flow Model)。
  • ThinkAct:基于Qwen2.5VL-7B并结合强化学习的模型。
  • RT-2:早期的视觉语言动作模型。

和本文相关性最高的3个文献

  1. OpenVLA (Kim et al., 2024):本文将其作为主要的基准(Baseline)进行对比,且复现了其在部分环境下的结果。
  2. pi0 (Black et al., 2024):本文复现了该模型并与VLM4VLA框架进行对比,指出了其扩散模型带来的不稳定性。
  3. Qwen2.5-VL (Bai et al., 2025b):本文实验中使用的核心VLM底座之一,也是阿里巴巴团队的同系列工作。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/29 1:22:53

单目测距MiDaS教程:从原理到实践的完整指南

单目测距MiDaS教程&#xff1a;从原理到实践的完整指南 1. 引言&#xff1a;AI 单目深度估计 - MiDaS 在计算机视觉领域&#xff0c;深度估计是实现三维空间感知的关键技术之一。传统方法依赖双目立体视觉或多传感器融合&#xff08;如激光雷达&#xff09;&#xff0c;但这些…

作者头像 李华
网站建设 2026/8/27 8:24:44

【机器视觉】YOLO中 P,R,F1曲线的含义

直击YOLO模型性能评估的核心&#xff0c;P、R、F1 及对应的曲线是衡量目标检测模型好坏的关键指标&#xff0c;三者紧密关联&#xff0c;且和你之前了解的 conf 置信度阈值直接挂钩。下面用 「基础概念→公式计算→曲线含义→YOLO实战关联」 的逻辑&#xff0c;小白也能看懂。 …

作者头像 李华
网站建设 2026/8/27 7:39:56

ResNet18物体识别懒人方案:按需付费,不用维护服务器

ResNet18物体识别懒人方案&#xff1a;按需付费&#xff0c;不用维护服务器 引言 作为小公司CTO&#xff0c;你是否遇到过这样的困境&#xff1a;想尝试AI项目赋能业务&#xff0c;却被高昂的IT运维成本和复杂的技术栈劝退&#xff1f;传统AI项目需要购买服务器、搭建环境、训…

作者头像 李华
网站建设 2026/8/27 8:30:14

【SVR-SVDD】基于支持向量-SVDD 进行异常检测研究附Matlab代码

✅作者简介&#xff1a;热爱科研的Matlab仿真开发者&#xff0c;擅长数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。&#x1f34e; 往期回顾关注个人主页&#xff1a;Matlab科研工作室&#x1f34a;个人信条&#xff1a;格物致知,完整Matlab代码及仿真咨询…

作者头像 李华
网站建设 2026/8/27 8:13:27

MiDaS模型实战:电商产品3D展示效果生成步骤详解

MiDaS模型实战&#xff1a;电商产品3D展示效果生成步骤详解 1. 引言&#xff1a;AI 单目深度估计的商业价值 在电商、虚拟试穿、AR购物等场景中&#xff0c;如何让二维图像“活”起来&#xff0c;呈现出真实的三维空间感&#xff0c;一直是技术攻坚的重点。传统方法依赖双目摄…

作者头像 李华
网站建设 2026/8/27 9:08:08

Rembg抠图多模型融合:提升精度的秘密

Rembg抠图多模型融合&#xff1a;提升精度的秘密 1. 智能万能抠图 - Rembg 在图像处理与内容创作领域&#xff0c;精准、高效地去除背景是许多应用场景的核心需求。无论是电商商品图精修、社交媒体内容制作&#xff0c;还是AI生成图像的后期处理&#xff0c;传统手动抠图耗时…

作者头像 李华