OpenVLA
Kim 2024 · 논문
한 줄 요약 — OpenVLA는 Open X-Embodiment의 97만 개 실제 로봇 시연으로 훈련된 70억 매개변수 오픈소스 비전-언어-행동 모델로, 훨씬 더 큰 폐쇄형 VLA를 능가하거나 대등하면서도 소비자용 GPU에서 효율적으로 미세 조정할 수 있습니다.
문제
인터넷 규모의 비전-언어 데이터와 다양한 로봇 시연에 대해 사전 훈련된 대형 정책은 로봇을 가르치는 새로운 방법을 제시합니다: 각각의 새로운 행동을 처음부터 훈련하는 대신 범용 비전-언어-행동(VLA) 모델을 미세 조정하는 것입니다. 그러나 이 채택은 두 가지 측면에서 막혀 있었습니다 — 기존 VLA(RT-2 등)는 아키텍처, 훈련 절차, 데이터 조합에 대한 가시성이 제한된 대체로 비공개였고, 이전 연구는 실용적 사용을 위한 핵심 단계인 상용 하드웨어에서 새 작업에 맞게 VLA를 효율적으로 미세 조정하는 방법을 탐구하지 않았습니다. OpenVLA는 이 두 장애물을 모두 제거하기 위해 시작되었습니다.
방법 및 아키텍처
- 백본: Prismatic-7B VLM — (1) 각 이미지 패치가 사전 훈련된 SigLIP(의미론적, 텍스트 정렬)과 DINOv2(저수준 공간적) 모두를 통과하고 특징 벡터가 채널 방향으로 연결되는 약 6억 매개변수의 이중 비전 인코더; (2) LLM 임베딩 공간으로의 2층 MLP 프로젝터; (3) Llama 2 7B 언어 백본. Prismatic 자체는 LLaVA-1.5 데이터 조합(약 100만 개 샘플)으로 튜닝되었습니다.
- 토큰으로서의 행동: 차원 연속 행동의 각 차원이 별도로 256개 빈 중 하나로 이산화되어, 개의 정수 를 생성합니다; 빈 폭은 훈련 행동의 1번째와 99번째 백분위수 사이 구간을 균등하게 나눕니다(RT-2의 최소-최대 경계 대신 사용하여, 이상치가 세분성을 파괴할 수 없게 합니다). Llama의 토크나이저가 100개의 특수 토큰만 예약하기 때문에, 가장 적게 사용되는 256개 토큰이 행동 토큰으로 덮어 씌워집니다. 훈련은 행동 토큰에 대해서만 표준 다음 토큰 교차 엔트로피를 최소화합니다.
- 훈련 데이터: Open X-Embodiment(70개 이상의 데이터셋, 200만 개 이상의 원시 궤적)에서 큐레이션된 97만 개의 궤적으로, 최소 하나의 3인칭 카메라를 갖는 단일 팔 말단 장치 제어 조작으로 필터링되고, Octo의 데이터 조합 휴리스틱으로 재가중되었습니다(DROID는 10% 가중치로 시도되었으나 지속적으로 낮은 행동 토큰 정확도로 인해 훈련 마지막 3분의 1에서 제외되었습니다).
- 경험적으로 발견된 설계 결정: 비전 인코더를 미세 조정하는 것이 VLA 성능에 핵심적입니다(VLM 관행과 반대로); 224×224 픽셀 입력은 384×384와 대등하면서 컴퓨팅은 3배 적게 사용합니다; VLA 훈련은 많은 에포크가 필요합니다 — 최종 실행은 행동 토큰 정확도가 95%를 초과할 때까지 27 에포크를 수행합니다; 고정 학습률 2e-5.
- 인프라: 64개의 A100에서 14일 동안 훈련되었으며(21,500 A100-시간, 배치 2048); 추론은 bfloat16에서 15GB가 필요하고 RTX 4090에서 약 6 Hz로 실행됩니다; 원격 추론 서버가 로봇에 행동을 스트리밍합니다.
- 효율적인 적응: LoRA는 모든 선형 레이어에서 저순위 업데이트를 학습하며(순위 로 충분함), 양자화된 int4 서빙은 메모리를 절반으로 줄입니다 — 둘 다 독립적인 주요 기여로 연구되었습니다.
실험 결과
- 즉시 사용 가능한 범용 제어: WidowX(BridgeData V2, 방법당 170회 롤아웃)와 Google 로봇(방법당 60회 롤아웃)에서 29개 작업에 걸쳐, OpenVLA는 매개변수가 7배 적으면서도 폐쇄형 55B RT-2-X를 절대 성공률 **16.5%**로 능가하며, RT-2-X가 웹 데이터로 공동 미세 조정되는 의미론적 일반화를 제외한 모든 BridgeData V2 카테고리에서 이를 상회합니다(OpenVLA는 그렇지 않습니다). RT-1-X와 Octo는 훨씬 뒤처집니다.
- 새 로봇으로의 미세 조정(Franka-Tabletop 5 Hz와 Franka-DROID 15 Hz, 작업당 10–150개 시연): 미세 조정된 OpenVLA는 가장 높은 종합 성능을 달성하며 테스트된 모든 작업에서 50% 이상의 성공률을 기록하는 유일한 방법입니다; 처음부터 훈련된 Diffusion Policy를 평균 20.4% 능가하는데, Diffusion Policy는 좁은 단일 지시 정교 작업에서만 우위를 유지합니다.
- 매개변수 효율적 미세 조정: LoRA r=32는 전체 매개변수의 단 1.4%(7,188M 중 97.6M)만 훈련하면서 68.2 ± 7.5%에 도달하며(전체 미세 조정의 69.7 ± 7.2% 대비) — 단일 A100에서 10–15시간, 8배의 컴퓨팅 절감입니다.
- 양자화된 추론: int4는 7.0GB 대 16.8GB VRAM에서 71.9 ± 4.7%를 기록합니다(bfloat16의 71.3 ± 4.8% 대비); int8은 1.2 Hz 추론이 5 Hz 제어기 역학을 깨뜨려 58.1%로 하락합니다.
- 모든 모델 체크포인트, 미세 조정 노트북, PyTorch 훈련 코드베이스(FSDP, FlashAttention, HuggingFace 통합)가 공개됩니다.
SLAM에서의 의미
OpenVLA는 기준 오픈 VLA이자 방대한 후속 로봇 학습 연구의 기반 모델로서, 70억 매개변수의 오픈 모델이 훨씬 더 큰 폐쇄형 시스템을 능가할 수 있음을 보여줍니다. SLAM 커뮤니티에게 이는 두 가지 측면에서 중요합니다: SigLIP/DINOv2 스타일의 기반 특징을 로봇 인식 백본으로 검증하며, 새롭게 등장하는 자율성 스택의 행동 측면을 정의합니다 — SLAM이 위치 추정과 미터법 맵을 제공하는 동안 VLA는 인식과 언어로부터 물리적 행동까지의 루프를 닫습니다.