RT-2

Brohan(DeepMind)2023 · 論文

一行要約 — RT-2はロボットの行動をテキストトークンとして表現し、大規模な視覚言語モデルをウェブ規模の視覚言語データとロボットの軌跡の両方で共同ファインチューニングすることで、インターネット知識をロボット制御に転移させ、「視覚-言語-行動(VLA)」モデルという用語を生み出した。

問題

従来のロボット学習はデータを大量に必要とし、脆弱である: 最も高性能な言語モデルと視覚言語モデルは、ウェブから得られた数十億のトークンと画像で学習されているが、この量に近いロボットデータが近い将来に揃う可能性は低い。LLM/VLMをロボティクスに取り込む先行の試みは、それらを主に高レベルの計画者として用い、コマンドを別個の低レベルコントローラが実行するプリミティブへと解析するものであり、これはウェブ知識から一切利益を得られない。RT-2は問う: 大規模な事前学習済み視覚言語モデルを低レベルのロボット制御に直接統合することで、汎化を高め、創発的な意味的推論を可能にできるか、と。

手法とアーキテクチャ

“terminateΔposxΔposyΔposzΔrotxΔrotyΔrotzgripper-extension”\text{“terminate} \enspace \Delta\text{pos}_{x} \enspace \Delta\text{pos}_{y} \enspace \Delta\text{pos}_{z} \enspace \Delta\text{rot}_{x} \enspace \Delta\text{rot}_{y} \enspace \Delta\text{rot}_{z} \enspace \text{gripper-extension”}

例: "1 128 91 241 5 101 127"。PaLI-Xでは、1000までの整数にはすでに一意なトークンが存在する; PaLM-Eでは、最も使用頻度の低い256個のトークンが行動トークンとして上書きされる(シンボルチューニングの一形態)。ロボットデータはVQA形式にキャストされる: 「Q: ロボットが[指示]をするには、どのような行動を取るべきか? A:」 に続いて行動文字列が続く。

実験結果

7自由度の移動操作ロボットで約6,000回の実ロボット試行にわたって評価される:

SLAMにおける意義

RT-2は、OpenVLA、NaVILA、WorldVLA、そしてそれに続くほとんどのロボット基盤モデルが採用した、トークンとしての行動というVLAパラダイムを確立し、ウェブ規模の事前学習が具現化された制御へ真に転移することを示した。SLAM研究者にとっては、Spatial AI時代の中心的な未解決の問いを枠付ける: ウェブ知識がポリシーを新しい物体に汎化させるのと同様に、SLAM式の空間知識(計量マップ、持続的なジオメトリ)を同じ方法で注入して、新しい環境と長期的なナビゲーションへの汎化を実現できるだろうか?

関連ノート