Spatial AI
Spatial AIとは、Andrew DavisonのFutureMapping論文群によって広められた用語であり、SLAM的な幾何的理解とセマンティックなシーン理解、および学習された世界表現が収束していくことを指す。そのビジョンとは、ロボットやデバイスは単に軌跡と点群を推定するだけでなく、周囲の空間に関する永続的で汎用的な表現 — 幾何、物体、セマンティクス、ダイナミクスを一体的に保持する表現 — を維持し、それをナビゲーション、操作、AR、対人インタラクションなどあらゆる下流タスクが問い合わせられるようにすべきだ、というものである。
SLAMの目標の再定義
古典的なSLAMは「自分はどこにいるのか、そして表面はどこにあるのか」に答える。Spatial AIはその先にある問いを立てる。
- マップ内にある何が存在するのか(物体、部屋、アフォーダンス)。単に表面点がどこにあるかだけではない。
- 表現はどのように保存されるべきか — 数時間・数日にわたって有用であり続け、コンパクトで、更新可能で、複数のタスク間で共有できるように。
- リアルタイムな空間知覚にはどのような計算とハードウェアが必要か(Davisonの FutureMapping 2 は、これについてグラフプロセッサや非ノイマン型ハードウェアを検討している)。
- どこまでを学習に委ねるべきか。 学習されたコンポーネント(深度事前分布、セマンティック特徴、生成モデル)は、手作りの幾何をますます置き換え、あるいは補強している。
3つの方向からの収束
この分野がこのビジョンへ向けて収束していく様子は、いくつかの方向から見て取れる。それぞれがこのロードマップの一部を占めている。
- セマンティックおよびオブジェクトレベルのSLAM(SemanticFusion、Kimeraと3D dynamic scene graphs、Hydra)は、マップにラベル、物体、階層構造 — 部屋、場所、エージェント — を付与することで、表面モデルを問い合わせ可能なシーンモデルへと変える。
- オープン語彙知覚は、マップを言語で問い合わせ可能にする。LERFはCLIP特徴をラディアンスフィールドに埋め込むことで、任意のテキストクエリで3D関連度マップを取得できるようにする。ConceptFusionとOpenFusionは密なCLIP特徴マップをオンラインで維持する(LERFに対するSLAM側の対応物である)。OpenMask3D系の手法はオープン語彙特徴を3Dセグメントに付与する。パターンは一貫している — SLAMが3D幾何を提供し、VLMがセマンティクスを提供し、両者が合わさってオープン語彙3Dシーン理解を生み出す。
- 世界モデルとVLM/VLAは、学習の側から同じ目標に取り組む。インターネット規模で獲得された暗黙的な空間知識であり、明示的な幾何をほとんど、あるいは全く伴わない — さらにVLAの場合は、知覚を行動に直接結びつける。
収束のスタック
これを一つの体系としてまとめる有用な方法は、以下のようなスタックとして見ることである。
Spatial AIとは、これらの層は継ぎ足すのではなく、共有された空間表現を中心に共同設計されるべきだという主張である。2つの設計パターンが競合している。
- モジュラー型: 各層が自身の専門性を保持する — SLAMが計量的精度とループクロージャによる補正可能性を備えた幾何的バックボーンを提供し、VLMが解釈を行い、VLA(あるいは古典的なプランナー)がその上で行動する。
- エンドツーエンド型: 単一の学習済みシステム(WorldVLA型、一部のRT-2構成)が明示的な幾何を完全に省略する。
正しい答えはおそらくタスクに依存する。既知の空間における精密な操作や長期のナビゲーションは明示的なSLAMを有利にし、オープンワールドの指示追従はエンドツーエンド型のアプローチを有利にするかもしれない。現在のほとんどのVLAは計量的な記憶を全く持っておらず — これはまさにSLAMがなお存在価値を持つ領域である。
SLAMと基盤モデルの境界にある未解決問題
これらは現在、研究フロンティアの多くを定義している。
- 言語で問い合わせ可能なSLAMマップ — CLIP/SigLIP特徴をリアルタイムSLAM(ConceptFusion、OpenFusion、LERF)に組み込み、セマンティックなシーンクエリを可能にする。
- SLAMに基づくVLA — SLAMが維持する計量マップをVLAの構造化された記憶として用い、計量的精度を伴う長期ナビゲーションを可能にする。
- 生成的マップ補完 — 生成的事前分布を用いて、未観測のマップ領域にありうる幾何を幻視・補完する。
- 世界モデルによるループクロージャ — 学習された動画予測を用いて、予測されたシーンと観測されたシーンが乖離した時点を検出する。これは幾何的なループクロージャの学習された代替手段である。
- 基盤モデルによるマップ事前分布 — 新規環境向けのSLAM初期化として、3D世界生成モデルを用いる。
SLAMにおける意義
Spatial AIは、現代のロードマップの背後にある「なぜ」の大部分を説明する。すなわち、疎な点マップから、密で、セマンティックで、階層的で、学習された表現へとこの分野が移行している理由を説明する。SLAMにおける研究や技術のキャリアを計画する誰にとっても、これはこのロードマップの幾何レベルと基盤モデルレベルを結びつける枠組みである — SLAMとより広いAIとの境界は解消しつつあり、最も価値のある実践者は幾何的な基礎と学習された表現の両方に精通している者となるだろう。