World model

**世界モデル(world model)**とは、環境のダイナミクスを学習した生成モデルである。現在の状態(および任意で行動)が与えられると、次に何が起こるかを予測する。形式的には、次のようなものを近似する。

st+1pθ(st+1st,at)s_{t+1} \sim p_\theta(s_{t+1} \mid s_t, a_t)

ここで「状態」は生のピクセル、潜在的な埋め込み、あるいは離散トークンであってよく、「行動」はロボットのコマンド、ステアリング入力、あるいは何もない(純粋な動画予測)場合もある。このモデルはロールアウトできる — 自身の予測を入力として与えることで数ステップ先までシミュレートできる — ため、内部シミュレータとして機能する。エージェントは実世界や手作りの物理エンジンに触れることなく、候補となる行動の結果を想像し、計画を立てられる。

系譜: 潜在的な想像からインターネット規模へ

このアイデアには2つの起源がある。強化学習においては、「世界モデル」の系譜(HaとSchmidhuberのWorld Models、続いてDreamerファミリー)が、特定の環境に対するコンパクトな潜在ダイナミクスモデルを学習し、モデルの想像の中で行動を学習する — 潜在空間での計画は、実環境での行動に比べて桁違いに安価である。最近の潮流はこの概念を保持しつつ、規模と機構を変えている。現代の世界モデルは、言語や動画生成と同じトークン/拡散の機構で構築され、インターネット規模あるいは車両群規模の動画で学習される。

これらすべての背後にある核心的な主張は、ダイナミクスはデータから学習できるということである — 交通の挙動、接触物理、照明など — これらは手でコード化するのではなく、十分な量の生の動画で学習されたモデルは、世界がどのように進展するかについての構造化された知識を獲得する。

世界モデルではないもの

世界モデルを、SLAMシステムが構築するマップと対比すると有用である。

SLAMマップ世界モデル
符号化するもの表面/ランドマークがどこにあるか(計量的な幾何)世界がどのように変化するか(ダイナミクス)
性質明示的、補正可能(ループクロージャ)暗黙的、学習された、生成的
強み計量的精度、安価なクエリ予測、未観測の未来の想像
弱み静的世界の仮定、予測不可コストが高く、幻覚を起こしやすく、計量的な保証が弱い

右列から2つの実践的な注意点が導かれる。第一に幻覚: 生成モデルは保証された未来ではなくありうる未来を生成するため、安全性が重要な計画にロールアウトを使うにはグラウンディング(それは明示的なマップが提供できる)が必要である。第二にコスト: SLAMマップへの問い合わせはほぼ無料であるが、数十億パラメータの動画モデルのロールアウトはそうではない — これが、提案されているハイブリッドアーキテクチャが世界モデルを短期の局所予測に限定して使う理由である。

世界モデルの利用: 想像による計画

標準的な利用パターンは、学習されたモデルによるモデル予測制御(MPC)である。各制御ステップにおいて次を行う。

  1. 現在の観測をモデルの状態 sts_t(トークンあるいは潜在表現)にエンコードする。
  2. 短いホライズン HH にわたって KK 個の候補行動シーケンス at:t+H(1),,at:t+H(K)a_{t:t+H}^{(1)}, \dots, a_{t:t+H}^{(K)}サンプリングする。
  3. 各候補をモデルでロールアウトする: s^t+1:t+H(k)pθ(st,at:t+H(k))\hat{s}_{t+1:t+H}^{(k)} \sim p_\theta(\cdot \mid s_t, a_{t:t+H}^{(k)}) — 実世界とのやりとりも、手作りのシミュレータも不要。
  4. 各想像された軌道を目標(タスク報酬、目標までの距離、衝突チェック)に対して評価する。
  5. 最良のシーケンスの最初の行動を実行し、観測し、繰り返す。

これは、WorldVLAがその自己回帰的ロールアウトで実行しているループそのものであり、Dreamerファミリーが潜在空間で実行しているループである。計画の質はステップ3の忠実度によって制約される — これが、規模(GAIA-1、Cosmos)や、明示的な幾何に対してロールアウトをグラウンディングすることに、現在多大な労力が注がれている理由である。

SLAMにおける意義

世界モデルとSLAMは、相補的な問いに対する収束していく答えである — 「自分はどこにいて、ここには何があるか」対「次に何が起こるか」。ありうる将来のSpatial AIスタックは、大域的な位置推定と計量的に正確なマッピングにSLAMを用い、局所的な予測と計画(「現在のマップに紐づけられた各候補行動の下で、数秒先をシミュレートする」)を世界モデルが担うというものである。世界モデルはまた、間接的にSLAM研究に貢献する。学習されたSLAMコンポーネントの学習用に多様な合成センサデータを生成すること(これはCosmosのようなプラットフォームの明示的な目標である)、そしてその創発的な3D一貫性が現在進行中の研究上の問いを提起すること — 大規模な動画モデルの内部には既に「マップ」がどれほど潜在しているのか、そして予測と観測のミスマッチは、幾何的なループクロージャの学習された代替手段として機能できるのか、といった問いである。

関連ノート