RT-2

Brohan (DeepMind) 2023 · 논문

한 줄 요약 — RT-2는 로봇 행동을 텍스트 토큰으로 표현하고 대형 비전-언어 모델을 웹 규모 비전-언어 데이터와 로봇 궤적 모두에 공동 미세 조정하여, 인터넷 지식을 로봇 제어로 전환하고 “비전-언어-행동”(VLA) 모델이라는 용어를 만들어냅니다.

문제

전통적인 로봇 학습은 데이터에 굶주리고 취약합니다: 가장 유능한 언어와 비전-언어 모델은 웹으로부터 수십억 개의 토큰과 이미지로 훈련되는데 — 이는 가까운 미래에 로봇 데이터로 맞추기 어려운 양입니다. LLM/VLM을 로봇 공학에 도입하려는 이전의 시도는 대부분 이들을 명령을 별도의 저수준 제어기가 실행하는 기본 동작으로 파싱하는 고수준 플래너로 사용했는데, 이는 웹 지식으로부터 전혀 혜택을 받지 못합니다. RT-2는 다음을 묻습니다: 대형 사전 훈련된 비전-언어 모델을 저수준 로봇 제어에 직접 통합하여 일반화를 향상시키고 창발적 의미론적 추론을 가능하게 할 수 있을까요?

방법 및 아키텍처

“terminateΔposxΔposyΔposzΔrotxΔrotyΔrotzgripper-extension”\text{“terminate} \enspace \Delta\text{pos}_{x} \enspace \Delta\text{pos}_{y} \enspace \Delta\text{pos}_{z} \enspace \Delta\text{rot}_{x} \enspace \Delta\text{rot}_{y} \enspace \Delta\text{rot}_{z} \enspace \text{gripper-extension”}

예: "1 128 91 241 5 101 127". PaLI-X의 경우 1000까지의 정수가 이미 고유한 토큰을 가지고 있습니다; PaLM-E의 경우 가장 적게 사용되는 256개의 토큰이 행동 토큰으로 덮어 씌워집니다(기호 튜닝의 한 형태). 로봇 데이터는 VQA 형식으로 구성됩니다: “Q: 로봇이 [지시]를 수행하려면 어떤 행동을 취해야 하는가? A:” 뒤에 행동 문자열이 이어집니다.

실험 결과

7자유도 이동식 조작기에서 약 6,000회의 실제 로봇 시행에 걸쳐 평가되었습니다:

SLAM에서의 의미

RT-2는 OpenVLA, NaVILA, WorldVLA, 그리고 대부분의 후속 로봇 기반 모델이 채택한 텍스트 토큰으로서의 행동 VLA 패러다임을 확립했으며, 웹 규모 사전 훈련이 실체화된 제어로 진정으로 전이됨을 보여주었습니다. SLAM 연구자들에게 이는 공간 AI 시대의 핵심적인 미해결 질문을 제시합니다: 웹 지식이 정책을 새로운 객체로 일반화시킬 수 있다면, SLAM 스타일의 공간 지식(미터법 맵, 영속적 기하)도 같은 방식으로 주입하여 새로운 환경과 장기 내비게이션으로 일반화할 수 있을까요?

관련 문서