NaVILA

Cheng 2024 · 논문

한 줄 요약 — NaVILA는 비전-언어-행동 패러다임을 탁상 조작으로부터 다리 로봇 내비게이션으로 확장하여, 자연어로 중간 수준 행동을 생성하는 비전-언어 모델과 이를 실행하는 RL 이동 정책을 결합함으로써 로봇이 실제 3D 환경을 통해 언어 지시를 따를 수 있게 합니다.

문제

다리 로봇을 이용한 시각-언어 내비게이션(VLN)은 두 가지 측면에서 매력적입니다: 언어는 인간이 로봇에 명령을 내리는 유연한 방법이며, 다리는 바퀴형 플랫폼이 감당할 수 없는 도전적이고 어지러운 장면을 로봇이 횡단할 수 있게 해줍니다. 그러나 인간의 지시를 관절 수준 제어까지 완전히 변환하는 것은 어렵습니다 — 조작용 VLA는 저수준 명령을 토큰으로 양자화하지만, LLM/VLM은 자연어로 훈련되었으며, 이들에게 정밀한 비언어적 행동을 생성하도록 강제하는 것은 사전 훈련된 바로 그 추론 능력에 부담을 줍니다. NaVILA는 언어 자체가 더 나은 행동 표현인지를 묻습니다.

방법 및 아키텍처

실험 결과

SLAM에서의 의미

NaVILA는 고전적 SLAM 기반 내비게이션 스택에 대한 기반 모델의 도전을 보여주는 구체적인 사례입니다: 명시적인 맵 구축 후 계획 파이프라인을 메모리 프레임 뱅크가 “맵” 역할을 하는 지시 조건부 정책으로 대체합니다. 동시에 그 설계는 기하학이 여전히 어디에 들어맞는지를 보여줍니다 — MASt3R 포즈 추정이 인간 비디오 훈련 데이터에 레이블을 붙이고, LiDAR 높이 맵이 로봇을 안전하게 유지하며, 미터법 위치 추정과 영속적인 맵은 VLA의 의미론적 명령 따르기와 상호 보완적입니다; VLA에 SLAM 기반 공간 메모리를 부여하는 하이브리드 시스템은 활발한 연구 방향입니다.

관련 문서