Spatial AI

Spatial AIとは、Andrew DavisonのFutureMapping論文群によって広められた用語であり、SLAM的な幾何的理解とセマンティックなシーン理解、および学習された世界表現が収束していくことを指す。そのビジョンとは、ロボットやデバイスは単に軌跡と点群を推定するだけでなく、周囲の空間に関する永続的で汎用的な表現 — 幾何、物体、セマンティクス、ダイナミクスを一体的に保持する表現 — を維持し、それをナビゲーション、操作、AR、対人インタラクションなどあらゆる下流タスクが問い合わせられるようにすべきだ、というものである。

SLAMの目標の再定義

古典的なSLAMは「自分はどこにいるのか、そして表面はどこにあるのか」に答える。Spatial AIはその先にある問いを立てる。

3つの方向からの収束

この分野がこのビジョンへ向けて収束していく様子は、いくつかの方向から見て取れる。それぞれがこのロードマップの一部を占めている。

収束のスタック

これを一つの体系としてまとめる有用な方法は、以下のようなスタックとして見ることである。

知覚SLAMマップ+姿勢VLM / scene graphsシーン理解VLA / planning行動\text{知覚} \xrightarrow{\text{SLAM}} \text{マップ+姿勢} \xrightarrow{\text{VLM / scene graphs}} \text{シーン理解} \xrightarrow{\text{VLA / planning}} \text{行動}

Spatial AIとは、これらの層は継ぎ足すのではなく、共有された空間表現を中心に共同設計されるべきだという主張である。2つの設計パターンが競合している。

正しい答えはおそらくタスクに依存する。既知の空間における精密な操作や長期のナビゲーションは明示的なSLAMを有利にし、オープンワールドの指示追従はエンドツーエンド型のアプローチを有利にするかもしれない。現在のほとんどのVLAは計量的な記憶を全く持っておらず — これはまさにSLAMがなお存在価値を持つ領域である。

SLAMと基盤モデルの境界にある未解決問題

これらは現在、研究フロンティアの多くを定義している。

  1. 言語で問い合わせ可能なSLAMマップ — CLIP/SigLIP特徴をリアルタイムSLAM(ConceptFusion、OpenFusion、LERF)に組み込み、セマンティックなシーンクエリを可能にする。
  2. SLAMに基づくVLA — SLAMが維持する計量マップをVLAの構造化された記憶として用い、計量的精度を伴う長期ナビゲーションを可能にする。
  3. 生成的マップ補完 — 生成的事前分布を用いて、未観測のマップ領域にありうる幾何を幻視・補完する。
  4. 世界モデルによるループクロージャ — 学習された動画予測を用いて、予測されたシーンと観測されたシーンが乖離した時点を検出する。これは幾何的なループクロージャの学習された代替手段である。
  5. 基盤モデルによるマップ事前分布 — 新規環境向けのSLAM初期化として、3D世界生成モデルを用いる。

SLAMにおける意義

Spatial AIは、現代のロードマップの背後にある「なぜ」の大部分を説明する。すなわち、疎な点マップから、密で、セマンティックで、階層的で、学習された表現へとこの分野が移行している理由を説明する。SLAMにおける研究や技術のキャリアを計画する誰にとっても、これはこのロードマップの幾何レベルと基盤モデルレベルを結びつける枠組みである — SLAMとより広いAIとの境界は解消しつつあり、最も価値のある実践者は幾何的な基礎と学習された表現の両方に精通している者となるだろう。

関連ノート