WorldVLA
Cen (Alibaba) 2025 · 논문
한 줄 요약 — WorldVLA는 비전-언어-행동 모델과 월드 모델을 하나의 자기회귀 Transformer로 통합하여 로봇 행동 토큰과 미래 이미지 토큰을 모두 예측하며, 이로써 환경 물리를 학습하는 것과 행동을 생성하는 것이 서로를 강화합니다.
문제
로봇 학습 파이프라인은 서로의 강점을 무시하는 두 진영으로 나뉘어 왔습니다. 비전-언어-행동 모델(RT-2, OpenVLA)은 관찰과 명령을 행동으로 매핑하지만, 행동을 오직 출력으로만 취급합니다 — 이해해야 할 입력으로는 결코 취급하지 않으므로 — 그 행동의 결과를 예측할 어떠한 메커니즘도 갖고 있지 않습니다. 월드 모델(GAIA-1, Cosmos)은 관찰과 행동으로부터 시각적 세계가 어떻게 전개되는지 예측하지만, 스스로는 아무런 행동도 만들어내지 않습니다. WorldVLA는 하나의 자기회귀 모델이 이 둘을 모두 할 수 있는지를 묻습니다: 행동과 이미지의 이해 및 생성을 단일 프레임워크로 통합할 수 있는가.
방법 및 아키텍처
WorldVLA는 이미지 관찰 , 행동 , 언어 명령 에 대한 행동(정책) 모델 와 월드 모델 를 정의합니다:
그리고 둘을 정책 헤드와 월드 헤드가 모든 가중치를 공유하는 단일 모델 로 통합합니다.
- 하나의 Transformer, 세 개의 토크나이저: 백본은 통합 이미지 이해/생성 MLLM인 Chameleon으로부터 초기화됩니다. 이미지 토크나이저는 VQ-GAN(압축률 16, 코드북 8192; 256×256 이미지당 256개 토큰, 512×512 이미지당 1024개 토큰)입니다. 행동 토크나이저는 7개 행동 차원(상대 위치 3개, 상대 각도 3개, 그리퍼 상태 1개) 각각을 256개 빈으로 이산화하므로, 하나의 행동은 7개 토큰입니다. 텍스트는 65,536개 단어 어휘의 BPE 토크나이저를 사용하는데, 이 어휘는 8192개의 이미지 코드와 256개의 행동 코드를 포함합니다 — 모든 모달리티가 하나의 어휘와 하나의 자기회귀 엔진을 공유합니다.
- 두 개의 인터리브된 데이터 형식: 행동 모델 샘플은 개의 관찰 이미지에 대해 “{명령}을 위해 로봇은 어떤 행동을 취해야 하는가?”를 묻고 오직 개의 출력 행동 토큰만 감독합니다(); 월드 모델 샘플은 “현재 이미지와 행동이 주어졌을 때 다음 프레임을 생성하라”를 묻고 오직 생성된 이미지 토큰만 감독하며(), 이를 번 반복합니다. 행동이 다음 상태를 완전히 결정하므로 월드 쪽에는 명령이 필요 없습니다.
- 훈련 목적 함수: 혼합 교차 엔트로피 손실
여기서 는 적은 수의 행동 토큰(7개)과 많은 수의 이미지 토큰(256/1024개) 사이의 균형을 맞춥니다.
- 행동 청크 주의 마스크: 순수한 인과적 주의는 청크 내의 이후 행동들이 이전에 예측된 행동에 의존하게 만듭니다; 행동이 MLLM 사전 훈련에 없었기 때문에 일반화가 약하고 오차가 전파됩니다. WorldVLA의 마스크는 각 행동이 텍스트와 이미지 토큰에만 주의를 기울이도록 하고 이전 행동에는 주의를 기울이지 않게 하여, 병렬 행동 생성을 가능하게 합니다; 월드 모델 쪽은 표준 인과 마스크를 유지합니다.
- 설정: 과거 프레임 개, 청크 크기 (LIBERO-Long의 경우 ), .
실험 결과
LIBERO 벤치마크(작업당 50회 롤아웃에 대한 성공률)에서, 512×512 WorldVLA는 Spatial / Object / Goal / Long에서 각각 87.6 / 96.2 / 83.4 / 60.0을 기록하며 평균 81.8로, 이산 행동 OpenVLA 기준선(평균 76.5)을 대규모 로봇 사전 훈련 없이 능가합니다; 256×256 변형은 평균 79.1입니다. Ablation 실험은 상호 강화 효과를 분리해 보여줍니다: 월드 모델 데이터를 추가하면 순수 행동 모델의 평균 성공률이 62.8에서 67.2로 상승합니다; 순수 자기회귀적 행동 청킹은 이를 54.0으로 붕괴시키지만, 제안된 주의 마스크는 76.6(전체 모델에서 월드 데이터를 더하면 78.1)으로 회복시킵니다. 요약하면: 동일 백본의 행동 전용 모델 대비 파지 성공률 약 +4%, 순수 청킹 대비 성공률 10–50% 하락, 마스크로 인한 4–23% 개선입니다. 반대 방향으로는, 행동 데이터가 월드 모델링을 향상시킵니다: 50프레임 롤아웃에서 FVD가 718.6에서 674.1로 (약 10% 개선) 낮아지고, PSNR이 순수 월드 모델 대비 23.98에서 24.30으로 상승합니다 — 순수 월드 모델은 물리에서 눈에 띄게 실패합니다(객체가 사라지거나 서랍이 열리지 않음). 월드 모델링 과제만으로 행동 모델을 사전 훈련하는 것도 도움이 됩니다(62.8에서 66.8로).
SLAM에서의 의미
WorldVLA는 이 레벨의 두 큰 흐름 — 월드 모델(GAIA-1, Cosmos)과 VLA(RT-2, OpenVLA) — 이 하나의 아키텍처로 수렴하는 지점을 보여주며, 세계를 예측하는 것과 그 안에서 행동하는 것 사이의 일관성 격차를 좁힙니다. 그 ablation 결과들은 SLAM 연구자들이 직관적으로 알고 있는 것을 수치로 보여줍니다: 운동의 기하학적 결과를 예측해야 하는 모델은 운동을 선택하기 위한 더 나은 표현을 학습하며, 그 역도 성립합니다. SLAM의 관점에서, 이는 공간 AI 스택의 그럴듯한 종착점을 그려 보입니다: 학습된 역학과 행동 생성이 하나의 모델로 융합되고, 명시적 SLAM 기하가 모델이 상상한 롤아웃을 제약하고 검증하는 미터법적 근거의 상보적 원천으로 남는 것입니다.