VLM vs VLA

Vision-Language Models (VLM) は、画像とテキストの両方で共同学習されたニューラルネットワークである。これらは視覚入力を推論する — 任意のテキストラベルに対して分類する、記述する、それについての質問に答える。Vision-Language-Action Models (VLA) は、VLMをある重要な一点で拡張する。すなわち、追加でロボットの行動を出力する。この違いは小さく聞こえるが、アーキテクチャ的にも思想的にも、知覚モジュールと方策(ポリシー)の違いに相当する。

VLM: 知覚と推論

このレベルにおけるVLMの系譜は、3つのアーキテクチャ世代を示している。

内部構造がどうであれ、VLMの出力は常に言語、埋め込み、あるいはスコアである — 知覚し理解するが、行動はしない。

VLA: 行動へのループを閉じる

RT-2によって導入された標準的な手法は、連続的なロボットコマンドをトークンに離散化することである。エンドエフェクタの位置/回転の差分、グリッパー状態、ナビゲーションの方位などは(例えば自由度ごとに256ビンで)ビン分割され、各ビンにはモデルの語彙内のトークンが割り当てられる。行動を出力することは、次に次トークン予測になる。現在のカメラ画像と言語指示が与えられると、モデルは自己回帰的に行動トークンを生成し、それがモーターコマンドにデコードされる。

対比表

VLMVLA
入力画像+テキスト画像+テキスト(+ロボットの状態/履歴)
出力テキスト、埋め込み、類似度スコアロボットの行動トークン(オプションでテキストも)
学習データインターネット上の画像-テキストペアVLMの初期化+ロボット実演データ
CLIP、SigLIP、BLIP-2、LLaVART-2、OpenVLA、NaVILA
ロボットにおける役割知覚とセマンティックな推論エンドツーエンド(あるいは高レベル)の制御方策

なぜVLMの上にVLAを構築するのか

転移である。ロボットの実演データセットはインターネットに比べて極めて小さいが、VLMバックボーンは既に、物体とは何か、それがどのように記述されるか、世界がおおよそどのように機能するかを知っている。RT-2の目玉となる成果は創発的な汎化であった — ロボットの学習では一度も見たことのない物体の操作や指示への追従が、単に基盤となるVLMがそれらをウェブ上で見ていたという理由だけで実現した。ロボットデータのみからVLAをゼロから学習することは、この事前知識を捨ててしまうことになる。

設計上の緊張関係 — そしてSLAMの位置づけ

VLAは知覚、推論、制御を単一のネットワークに集約し、エンドツーエンドの最適化を行うが、その代わりにモジュラー型のロボットスタックが維持している明示的な幾何状態(マップ、姿勢)を放棄する。モジュラー型のパターンでは、スタックは次のように書ける。

知覚SLAMマップ+姿勢VLMシーン理解VLA行動\text{知覚} \xrightarrow{\text{SLAM}} \text{マップ+姿勢} \xrightarrow{\text{VLM}} \text{シーン理解} \xrightarrow{\text{VLA}} \text{行動}

エンドツーエンドの代替案は、明示的な幾何を完全に省略する。どちらが優れているかはおそらくタスクに依存する。既知の空間における精密な操作や長期のナビゲーションは明示的なSLAM状態を有利にし、短期的でオープンワールドな指示追従はエンドツーエンドの方策を有利にするかもしれない。現在のほとんどのVLAは計量的な記憶を全く持っておらず — これはまさにSLAMが再び登場する場面である。

SLAMにおける意義

VLMは既にSLAMを再形成しつつある。CLIP型の埋め込みを3Dマップに付与することで、任意の自由形式テキストでマップを問い合わせられるオープン語彙シーン理解(LERF、ConceptFusion)が得られる。VLAは、この分野にとってより大きなアーキテクチャ上の問いを提起する — 将来のロボットは、その上でVLAが計画を立てる明示的なSLAMマップを使うのか(SLAMをVLAに欠けている計量的記憶として使う)、それとも明示的な幾何を完全に迂回するエンドツーエンドの方策を使うのか。それぞれのモデルクラスがどこで強みを持つかを知ることは、古典的な空間表現が今なお存在価値を持つ領域 — 長期ナビゲーション、計量精度、永続的なマップ — を教えてくれる。

関連ノート