OpenVLA

Kim 2024 · 논문

한 줄 요약 — OpenVLA는 Open X-Embodiment의 97만 개 실제 로봇 시연으로 훈련된 70억 매개변수 오픈소스 비전-언어-행동 모델로, 훨씬 더 큰 폐쇄형 VLA를 능가하거나 대등하면서도 소비자용 GPU에서 효율적으로 미세 조정할 수 있습니다.

문제

인터넷 규모의 비전-언어 데이터와 다양한 로봇 시연에 대해 사전 훈련된 대형 정책은 로봇을 가르치는 새로운 방법을 제시합니다: 각각의 새로운 행동을 처음부터 훈련하는 대신 범용 비전-언어-행동(VLA) 모델을 미세 조정하는 것입니다. 그러나 이 채택은 두 가지 측면에서 막혀 있었습니다 — 기존 VLA(RT-2 등)는 아키텍처, 훈련 절차, 데이터 조합에 대한 가시성이 제한된 대체로 비공개였고, 이전 연구는 실용적 사용을 위한 핵심 단계인 상용 하드웨어에서 새 작업에 맞게 VLA를 효율적으로 미세 조정하는 방법을 탐구하지 않았습니다. OpenVLA는 이 두 장애물을 모두 제거하기 위해 시작되었습니다.

방법 및 아키텍처

실험 결과

SLAM에서의 의미

OpenVLA는 기준 오픈 VLA이자 방대한 후속 로봇 학습 연구의 기반 모델로서, 70억 매개변수의 오픈 모델이 훨씬 더 큰 폐쇄형 시스템을 능가할 수 있음을 보여줍니다. SLAM 커뮤니티에게 이는 두 가지 측면에서 중요합니다: SigLIP/DINOv2 스타일의 기반 특징을 로봇 인식 백본으로 검증하며, 새롭게 등장하는 자율성 스택의 행동 측면을 정의합니다 — SLAM이 위치 추정과 미터법 맵을 제공하는 동안 VLA는 인식과 언어로부터 물리적 행동까지의 루프를 닫습니다.

관련 문서