NaVILA

Cheng 2024 · 論文

一行要約 — NaVILAは、視覚-言語-行動のパラダイムをテーブルトップの操作から脚式ロボットのナビゲーションへと拡張し、中間レベルの行動を自然言語で出力する視覚言語モデルと、それを実行するRL歩行ポリシーを組み合わせることで、ロボットが実際の3D環境の中で言語指示に従って移動できるようにする。

問題

脚式ロボットによる視覚言語ナビゲーション(VLN)は二重の意味で魅力的である: 言語は人間がロボットに指示を出す柔軟な手段であり、脚は車輪型のベースでは通行できない困難で混雑したシーンを走破できる。しかし、人間の指示を関節レベルの制御まで変換するのは難しい——操作型のVLAは低レベルのコマンドをトークンに量子化するが、LLM/VLMは自然言語で学習されているため、精密で非言語的な行動を出力させることは、事前学習で獲得した推論能力そのものに負荷をかける。NaVILAは、言語自体がより良い行動表現であるかを問う。

手法とアーキテクチャ

実験結果

SLAMにおける意義

NaVILAは、古典的なSLAMベースのナビゲーションスタックに対する基盤モデルの挑戦の具体例である: 明示的なマップ構築後に計画を行うパイプラインを、その「マップ」がメモリフレームのバンクである、指示条件付きポリシーに置き換える。同時に、その設計はジオメトリがどこでまだ有効かも示している——MASt3Rの姿勢推定が人間の動画学習データにラベル付けを行い、LiDAR高さマップがロボットの安全を保ち、計量的な位置推定と持続的なマップはVLAの意味的な指示追従を補完する; VLAにSLAMに基づく空間的なメモリを与えるハイブリッドシステムは、活発な研究方向である。

関連ノート