NaVILA
Cheng 2024 · 논문
한 줄 요약 — NaVILA는 비전-언어-행동 패러다임을 탁상 조작으로부터 다리 로봇 내비게이션으로 확장하여, 자연어로 중간 수준 행동을 생성하는 비전-언어 모델과 이를 실행하는 RL 이동 정책을 결합함으로써 로봇이 실제 3D 환경을 통해 언어 지시를 따를 수 있게 합니다.
문제
다리 로봇을 이용한 시각-언어 내비게이션(VLN)은 두 가지 측면에서 매력적입니다: 언어는 인간이 로봇에 명령을 내리는 유연한 방법이며, 다리는 바퀴형 플랫폼이 감당할 수 없는 도전적이고 어지러운 장면을 로봇이 횡단할 수 있게 해줍니다. 그러나 인간의 지시를 관절 수준 제어까지 완전히 변환하는 것은 어렵습니다 — 조작용 VLA는 저수준 명령을 토큰으로 양자화하지만, LLM/VLM은 자연어로 훈련되었으며, 이들에게 정밀한 비언어적 행동을 생성하도록 강제하는 것은 사전 훈련된 바로 그 추론 능력에 부담을 줍니다. NaVILA는 언어 자체가 더 나은 행동 표현인지를 묻습니다.
방법 및 아키텍처
- 2단계 프레임워크: VILA 기반 VLM이 의미론적 명령 따르기를 처리하고 언어로 표현된 중간 수준 행동을 출력합니다 — 예: “우측으로 30도 회전”, “75cm 전진” — 반면 별도의 저수준 시각 이동 정책이 이를 실시간으로 관절 움직임으로 변환합니다. VLA는 저주파로 실행되며; 이동 정책은 실시간으로 실행되어 장애물 회피와 균형을 흡수합니다.
- VLM (고수준): VILA의 비전 인코더 → MLP 프로젝터 → LLM, 모두 SFT 동안 동결 해제됩니다. 내비게이션 프롬프트는 최신 프레임(“현재 관찰”)을 균일하게 샘플링된 이전 프레임(“과거 관찰의 비디오”라는 메모리 뱅크)과 구별하며, 새로운 특수 토큰 대신 텍스트 신호를 사용합니다; 8-64개의 프레임이 사용됩니다. 정규식 파서가 LLM 출력에서 행동 유형과 그 인자(거리/각도)를 추출합니다 — 실험적으로 생성된 모든 행동이 성공적으로 파싱되었습니다.
- SFT 데이터 조합: (1) R2R-CE와 RxR-CE로부터 최단 경로 추종기를 통한 시뮬레이션 내비게이션, 연속된 행동을 병합(최대 3개, 예: 두 번의 25cm 걸음 → 한 번의 50cm 걸음)하고 정지 행동을 재균형화; (2) 실제 인간 투어 비디오 — 2K개의 자기중심 YouTube 비디오를 20K개의 궤적으로 샘플링하고, MASt3R 미터법 카메라 포즈 추정으로 행동을 복원하고 VLM 캡셔닝 + LLM 재구성으로 지시를 생성(연속적인 환경에서 실제 인간 비디오로 내비게이션을 직접 훈련한 최초의 연구); (3) 보조 작업 — EnvDrop 증강 지시, 궤적 요약, ScanQA 3D 질문 응답; (4) 세계 지식을 유지하기 위한 일반 VQA.
- 이동 정책 (저수준): 이산 명령은 속도 명령 으로 변환되어 VLA가 명시한 거리/각도에 맞는 시간 동안 실행됩니다. 단일 단계 PPO 정책(교사-학생 증류 없음)이 Unitree Go2의 다리 모터에 대한 목표 관절 위치 를 출력합니다. 크리틱은 특권적인 지형 높이 스캔을 보며; 액터는 실제 세계에서 사용 가능한 자기수용 이력과 LiDAR 포인트 클라우드로 구축된 2.5D 높이 맵(Unitree L1, 360°×90° FoV, 최근 5회 스캔에 대한 max-filter)만을 봅니다 — LiDAR는 깊이/RGB가 실패하는 유리와 강한 햇빛을 처리합니다. Isaac Lab에서의 레이캐스팅은 RTX 4090에서 60K FPS 이상의 훈련 처리량을 제공합니다.
- VLN-CE-Isaac 벤치마크: Habitat 스타일의 텔레포트 에이전트가 아니라 전체 물리 관절 수준 실행을 평가하는, 1,077개의 통과 가능한 R2R Val-Unseen 궤적을 갖는 새로운 Isaac Sim 벤치마크.
실험 결과
- VLN-CE 벤치마크(Val-Unseen): R2R-CE에서 NaVILA는 단일 뷰 RGB만 사용하여 SR 54.0 / SPL 49.0 / NE 5.22를 달성합니다 — 이전 단일 뷰 SoTA인 NaVid(SR 37.0) 대비 약 17% SR 향상이며 파노라마, 깊이, 오도메트리, 시뮬레이터 사전 훈련된 웨이포인트 예측기를 사용하는 방법들과 비교하거나 이를 상회합니다; RxR-CE에서는 SR 49.3 / SPL 44.0 / nDTW 58.8을 기록합니다.
- 데이터셋 간 제로샷(R2R로만 훈련, RxR Val-Unseen에서 테스트): SR 34.3 대 NaVid의 23.8.
- 장면 이해: ScanQA 검증 세트에서 NaVILA(64 프레임)는 이전 VLA SoTA인 NaviLLM의 75.9 대비 CIDEr 102.7을 기록하며, 스캔이나 포즈가 있는 RGB-D가 필요한 3D LMM조차 능가합니다.
- 이동: 증류 기반 ROA와 비교하여, 선형/각속도 오차가 0.161/0.152에서 0.066/0.113으로 감소하고 충돌률이 3.09에서 0.81로 감소합니다.
- VLN-CE-Isaac: 시각 기반 정책은 블라인드(자기수용 전용) 정책보다 Go2에서 SR 14% 향상(50.2 대 36.2), H1 인간형 로봇에서 21% 향상(45.3 대 24.4)을 보이며, 오라클 실행 상한(51.3)에 근접합니다.
- 실제 세계: 작업 공간, 가정, 실외 장면에서 25개 지시 × 3회 시행에 걸쳐, NaVILA는 88%의 성공률(복잡한 다중 방 지시에서는 75%)을 달성하며, GPT-4o 기준선을 상회합니다; 동일한 VLA는 재훈련 없이 카메라 높이와 시야각이 다른 Booster T1 인간형 로봇도 작동시킵니다.
SLAM에서의 의미
NaVILA는 고전적 SLAM 기반 내비게이션 스택에 대한 기반 모델의 도전을 보여주는 구체적인 사례입니다: 명시적인 맵 구축 후 계획 파이프라인을 메모리 프레임 뱅크가 “맵” 역할을 하는 지시 조건부 정책으로 대체합니다. 동시에 그 설계는 기하학이 여전히 어디에 들어맞는지를 보여줍니다 — MASt3R 포즈 추정이 인간 비디오 훈련 데이터에 레이블을 붙이고, LiDAR 높이 맵이 로봇을 안전하게 유지하며, 미터법 위치 추정과 영속적인 맵은 VLA의 의미론적 명령 따르기와 상호 보완적입니다; VLA에 SLAM 기반 공간 메모리를 부여하는 하이브리드 시스템은 활발한 연구 방향입니다.