GAIA-1

Wayve 2023 · 論文

一行要約 — GAIA-1(“Generative AI for Autonomy”)は、動画、テキスト、自車の行動を入力として受け取り、自車の挙動を細かく制御しながら現実的な将来の運転シナリオを生成する生成的世界モデルであり、生の運転データから道路挙動の暗黙的な規則を学習する。

問題

現実世界のシナリオが持つ非構造化された複雑さを安全に走行できる自動運転システムの構築は依然として難しく、その重要な部分問題が予測である。すなわち、世界が進展する中で車両の行動に応じて生じ得る様々な潜在的結果を予見することである。従来の世界モデルは、ラベル付きデータや低次元のシミュレートされた表現に依存しており、複雑な実シーンの現実的なサンプルを生成できなかった。一方、動画生成器は説得力のあるピクセルを生成するものの、進展する世界の力学の表現は弱い。GAIA-1は両者の良い部分を両立させることを目指す: 生成的動画モデルのスケーラビリティと現実感、そして世界モデルによる将来の意味のある表現である。

手法とアーキテクチャ

GAIA-1には3つの学習可能なコンポーネントがある: 画像トークナイザ、自己回帰的世界モデル、動画拡散デコーダである。

Lworld model=t=1Ti=1nlogp(zt,iz<t,  zt,j<i,  ct,  a<t)L_{\text{world model}} = -\sum_{t=1}^{T}\sum_{i=1}^{n} \log p\big(z_{t,i} \mid \mathbf{z}_{<t},\; z_{t,j<i},\; \mathbf{c}_{\leq t},\; \mathbf{a}_{<t}\big)

ここで zt,iz_{t,i} は画像トークン、c\mathbf{c} はテキストトークン、a\mathbf{a} は行動トークンである。条件付けドロップアウト(20%/40%/40% 無条件/行動条件/テキスト条件)により、1つのモデルで無条件生成、行動条件付き生成、テキスト条件付き生成が可能になる。

Lvideo=Eϵ,t[ϵθ(xt,t,z,m)ϵ22]L_{\text{video}} = \mathbb{E}_{\epsilon, t'}\Big[\big\lVert \epsilon_\theta(\mathbf{x}^{t'}, t', \mathbf{z}, \mathbf{m}) - \epsilon \big\rVert_2^2\Big]

ここで xt=αtx+σtϵ\mathbf{x}^{t'} = \alpha_{t'}\mathbf{x} + \sigma_{t'}\epsilon はノイズが付加された動画、z\mathbf{z} は条件付け画像トークン、m\mathbf{m} はタスク固有のマスクである。トークンをピクセルにレンダリングし、6.25 Hzから12.5 Hz、25 Hzへと時間的にアップサンプリングする(DDIM、50ステップ)。安定性のため最後のフレームから逆方向にデコードする。

実験結果

2019年から2023年にかけての、ロンドンの都市部での走行に関する4,700時間の独自データ(25 Hz、約4億2000万枚の画像)で学習され、特徴バランスサンプリングが用いられる; 検証には厳密なジオフェンスを設けた400時間の未使用データを用いる。世界モデルは64基のA100 80GB GPUで15日間、100kステップ学習され、デコーダは32基のA100で300kステップ学習された。GAIA-1はLLMのようなスケーリング則に従う: 0.65Mから650Mパラメータのモデル(トークンあたりの計算量 C=6NC=6N)に冪乗則 f(x)=c+(x/a)bf(x) = c + (x/a)^{b} をフィッティングすることで、計算量が20×20\times未満の実行結果から最終的な6.5Bモデルの検証クロスエントロピーを正確に予測でき、外挿はさらなるデータと計算量から相当な余地があることを示している。実証された能力は定性的なものである(標準的なベンチマーク数値は報告されていない): 数分間にわたる安定した完全に想像上の走行; 1つの動画プロンプトから複数のもっともらしい未来(道の譲り合い、ラウンドアバウトでの選択、様々な交通状況); 天候と照明のテキストによる制御; そして分布外に外挿する行動制御——自車を車線外に操舵させる、専門家データでは一度も見られなかった状況でも、幾何的に正確なシーンと反応的なエージェント(対向車が衝突を避けるよう操作する)が得られる。

SLAMにおける意義

GAIA-1は、自動運転における「シミュレータとしての世界モデル」の型を確立した: 手作りの物理法則と挙動ルール(CARLA式のシミュレータ)の代わりに、力学は生データから学習され、多様な合成学習シナリオを生成するために生成的に問い合わせられる。速度バンプでのピッチ/ロールや一貫した道路レイアウトといった3Dジオメトリの創発的な理解は、純粋に次トークン予測から生じたものである。これはNVIDIA Cosmosのような後続の世界基盤モデルに直接影響を与えた。SLAM研究者にとっては、明示的な計量マップが暗黙的に学習された力学とどのように結びつくべきかという、Spatial AIの中心的な問いを提起する——例えば、SLAMを位置推定に用いつつ、世界モデルが計画のために短期的な未来を想像する、といった形である。

関連ノート