RT-2
Brohan (DeepMind) 2023 · 논문
한 줄 요약 — RT-2는 로봇 행동을 텍스트 토큰으로 표현하고 대형 비전-언어 모델을 웹 규모 비전-언어 데이터와 로봇 궤적 모두에 공동 미세 조정하여, 인터넷 지식을 로봇 제어로 전환하고 “비전-언어-행동”(VLA) 모델이라는 용어를 만들어냅니다.
문제
전통적인 로봇 학습은 데이터에 굶주리고 취약합니다: 가장 유능한 언어와 비전-언어 모델은 웹으로부터 수십억 개의 토큰과 이미지로 훈련되는데 — 이는 가까운 미래에 로봇 데이터로 맞추기 어려운 양입니다. LLM/VLM을 로봇 공학에 도입하려는 이전의 시도는 대부분 이들을 명령을 별도의 저수준 제어기가 실행하는 기본 동작으로 파싱하는 고수준 플래너로 사용했는데, 이는 웹 지식으로부터 전혀 혜택을 받지 못합니다. RT-2는 다음을 묻습니다: 대형 사전 훈련된 비전-언어 모델을 저수준 로봇 제어에 직접 통합하여 일반화를 향상시키고 창발적 의미론적 추론을 가능하게 할 수 있을까요?
방법 및 아키텍처
- 백본: 두 개의 사전 훈련된 VLM이 VLA로 적응됩니다 — PaLI-X(5B와 55B)와 PaLM-E(12B)로, RT-2-PaLI-X와 RT-2-PaLM-E를 만듭니다. 둘 다 이미지와 텍스트를 입력받아 토큰 시퀀스를 출력합니다; 새로운 매개변수나 행동 헤드는 추가되지 않습니다.
- 텍스트 토큰으로서의 행동: 행동 공간은 말단 장치의 6자유도 위치 및 회전 변위와 그리퍼 확장, 이산 에피소드 종료 명령입니다. 각 연속 차원은 256개의 균일한 빈으로 이산화되어, 행동이 8개의 정수가 되고, 하나의 문자열로 연결됩니다:
예: "1 128 91 241 5 101 127". PaLI-X의 경우 1000까지의 정수가 이미 고유한 토큰을 가지고 있습니다; PaLM-E의 경우 가장 적게 사용되는 256개의 토큰이 행동 토큰으로 덮어 씌워집니다(기호 튜닝의 한 형태). 로봇 데이터는 VQA 형식으로 구성됩니다: “Q: 로봇이 [지시]를 수행하려면 어떤 행동을 취해야 하는가? A:” 뒤에 행동 문자열이 이어집니다.
- 공동 미세 조정: 핵심 훈련 레시피 — VLM은 원래의 웹 규모 비전-언어 작업(VQA, 캡셔닝, 이미지-텍스트 인터리브)과 RT-1의 로봇 시연 데이터(오피스 키친 환경에서 17개월에 걸친 13개 로봇)의 혼합으로 미세 조정되며, 배치별로 로봇 데이터의 가중치가 높아집니다. 이는 웹 개념을 로봇 데이터로 덮어쓰는 대신 보존합니다.
- 제약된 디코딩: 로봇 작업이 프롬프트로 제공되면, 샘플링은 유효한 행동 토큰으로 제한됩니다; 비전-언어 작업에서는 전체 어휘가 사용 가능합니다.
- 실시간 추론: 모델은 네트워크를 통해 질의되는 다중 TPU 클라우드 서비스에서 실행됩니다 — 55B 모델은 1–3 Hz, 5B 모델은 약 5 Hz — 당시 직접적인 폐루프 로봇 제어에 사용된 가장 큰 모델로, 이전 기록보다 한 자릿수 이상 큽니다.
- 연쇄적 사고 변형: RT-2-PaLM-E는 “Plan:” 단계로 증강된 데이터에서 수백 스텝 동안 미세 조정됩니다(예: “Instruction: I’m hungry. Plan: pick rxbar chocolate. Action: 1 128 124 136 121 158 111 255”), 시각적 추론과 행동 생성을 연결합니다.
실험 결과
7자유도 이동식 조작기에서 약 6,000회의 실제 로봇 시행에 걸쳐 평가되었습니다:
- 본 작업 대 일반화: 200개 이상의 본 지시에서 RT-2는 RT-1과 유사한 성능을 보이지만, 280개 이상의 보지 못한 객체/배경/환경 작업에서는 RT-2의 두 인스턴스 모두 RT-1과 MOO의 약 2배, 다른 기준선(VC-1, R3M)의 약 6배 성공률을 평균적으로 기록합니다.
- 창발적 능력(기호 이해, 추론, 사람 인식 — 로봇 데이터에는 없음): RT-2-PaLI-X-55B는 RT-1의 17%, VC-1의 11% 대비 평균 **60%**의 성공률을 기록합니다 — 약 3배 향상; RT-2-PaLM-E-12B는 평균 40%이지만 수학 스타일 추론에서 더 강합니다.
- Ablation: 처음부터 훈련하면 5B에서도 매우 저조합니다; 공동 미세 조정은 모든 규모에서 로봇 전용 미세 조정을 능가합니다; 55B는 5B보다 더 잘 일반화됩니다.
- Language-Table (오픈소스 시뮬레이션): RT-2-PaLI-3B는 RT-1의 74 ± 13, LAVA의 77 ± 4, BC-Zero의 72 ± 3 대비 90 ± 10을 기록합니다.
- 한계: 새로운 동작은 창발되지 않습니다 — 물리적 스킬은 로봇 데이터 분포 내에 머무릅니다; 웹 지식은 어떤 스킬이 존재하는지가 아니라 스킬이 어떻게 배치되는지를 변화시킵니다.
SLAM에서의 의미
RT-2는 OpenVLA, NaVILA, WorldVLA, 그리고 대부분의 후속 로봇 기반 모델이 채택한 텍스트 토큰으로서의 행동 VLA 패러다임을 확립했으며, 웹 규모 사전 훈련이 실체화된 제어로 진정으로 전이됨을 보여주었습니다. SLAM 연구자들에게 이는 공간 AI 시대의 핵심적인 미해결 질문을 제시합니다: 웹 지식이 정책을 새로운 객체로 일반화시킬 수 있다면, SLAM 스타일의 공간 지식(미터법 맵, 영속적 기하)도 같은 방식으로 주입하여 새로운 환경과 장기 내비게이션으로 일반화할 수 있을까요?