OpenVLA

Kim 2024 · 论文

一句话总结 — OpenVLA 是一个 70 亿参数的开源视觉-语言-动作模型,基于 Open X-Embodiment 中 97 万条真实机器人演示数据训练,在性能上匹配甚至超越规模更大的闭源 VLA,同时能够在消费级 GPU 上高效微调。

问题

在互联网规模的视觉语言数据以及多样化机器人演示数据上进行预训练的大型策略模型,为教机器人新技能提供了一种新方式:微调一个通用的视觉-语言-动作(VLA)模型,而不是为每个新行为从零开始训练。但这一方向的推广受阻于两个方面——现有的 VLA(RT-2 及其同类)大多是闭源的,对架构、训练流程和数据配比的可见性有限;此前的工作也没有探索如何在商用硬件上高效微调 VLA 以适配新任务,而这正是实际应用的关键一步。OpenVLA 旨在消除这两个障碍。

方法与架构

实验结果

对SLAM的意义

OpenVLA 是参照级的开源 VLA,也是后续大量机器人学习工作的基础模型,证明了一个 7B 的开源模型可以超越规模远大得多的闭源系统。对 SLAM 社区而言,它的意义体现在两方面:它验证了 SigLIP/DINOv2 风格的基础模型特征可作为机器人感知骨干网络,并且它定义了新兴自主性技术栈中动作侧的角色——SLAM 提供定位和度量地图,而 VLA 则把感知和语言闭环到物理动作。

相关条目