GAIA-1
Wayve 2023 · 論文
一行要約 — GAIA-1(“Generative AI for Autonomy”)は、動画、テキスト、自車の行動を入力として受け取り、自車の挙動を細かく制御しながら現実的な将来の運転シナリオを生成する生成的世界モデルであり、生の運転データから道路挙動の暗黙的な規則を学習する。
問題
現実世界のシナリオが持つ非構造化された複雑さを安全に走行できる自動運転システムの構築は依然として難しく、その重要な部分問題が予測である。すなわち、世界が進展する中で車両の行動に応じて生じ得る様々な潜在的結果を予見することである。従来の世界モデルは、ラベル付きデータや低次元のシミュレートされた表現に依存しており、複雑な実シーンの現実的なサンプルを生成できなかった。一方、動画生成器は説得力のあるピクセルを生成するものの、進展する世界の力学の表現は弱い。GAIA-1は両者の良い部分を両立させることを目指す: 生成的動画モデルのスケーラビリティと現実感、そして世界モデルによる将来の意味のある表現である。
手法とアーキテクチャ
GAIA-1には3つの学習可能なコンポーネントがある: 画像トークナイザ、自己回帰的世界モデル、動画拡散デコーダである。
- 画像トークナイザ(0.3B): 完全畳み込み型の2D U-Net離散オートエンコーダが、各 フレームを でダウンサンプルし、語彙数 の トークンを得る(約 のビット圧縮)。画像再構成損失(、、知覚損失、GAN)、量子化損失、そして帰納バイアス損失——事前学習済みDINO特徴のコサイン類似度蒸留によりトークンを高周波ではなく意味的にするもの——で学習される。
- 統一トークン系列: 各タイムステップにおいて、トークンはテキスト-画像-行動の順にインターリーブされる: テキストは固定されたT5-large( トークン)経由、行動は線形埋め込みされた 個のスカラー(速度、曲率)であり、すべてが因数分解された時空間位置埋め込みを持つ共有の 空間に配置される。動画は6.25 Hzにサブサンプルされる; フレーム(4秒)により合計系列長は となる。
- 世界モデル(6.5B): 過去のすべてのトークンから次の画像トークンを予測するよう学習された、因果マスキングを持つ自己回帰型トランスフォーマーである:
ここで は画像トークン、 はテキストトークン、 は行動トークンである。条件付けドロップアウト(20%/40%/40% 無条件/行動条件/テキスト条件)により、1つのモデルで無条件生成、行動条件付き生成、テキスト条件付き生成が可能になる。
- 動画デコーダ(2.6B): 因数分解された空間/時間注意を持つ3D U-Net動画拡散モデルで、マルチタスク(画像生成、動画生成、順方向/逆方向自己回帰デコード、補間)で、パラメータ化によるノイズ除去目的関数で学習される:
ここで はノイズが付加された動画、 は条件付け画像トークン、 はタスク固有のマスクである。トークンをピクセルにレンダリングし、6.25 Hzから12.5 Hz、25 Hzへと時間的にアップサンプリングする(DDIM、50ステップ)。安定性のため最後のフレームから逆方向にデコードする。
- 推論: argmaxサンプリングは繰り返しループに陥りやすく、フルサンプリングは分布の信頼できない裾野に当たってしまうため、top-kサンプリングが用いられる; 長いロールアウトにはスライディングウィンドウを用いる。テキストへの追従には分類器フリーガイダンスが用いられる: 、トークンとフレームにわたってガイダンスをスケジューリングし、無条件ロジットに置き換えることでネガティブプロンプティングを行う。
実験結果
2019年から2023年にかけての、ロンドンの都市部での走行に関する4,700時間の独自データ(25 Hz、約4億2000万枚の画像)で学習され、特徴バランスサンプリングが用いられる; 検証には厳密なジオフェンスを設けた400時間の未使用データを用いる。世界モデルは64基のA100 80GB GPUで15日間、100kステップ学習され、デコーダは32基のA100で300kステップ学習された。GAIA-1はLLMのようなスケーリング則に従う: 0.65Mから650Mパラメータのモデル(トークンあたりの計算量 )に冪乗則 をフィッティングすることで、計算量が未満の実行結果から最終的な6.5Bモデルの検証クロスエントロピーを正確に予測でき、外挿はさらなるデータと計算量から相当な余地があることを示している。実証された能力は定性的なものである(標準的なベンチマーク数値は報告されていない): 数分間にわたる安定した完全に想像上の走行; 1つの動画プロンプトから複数のもっともらしい未来(道の譲り合い、ラウンドアバウトでの選択、様々な交通状況); 天候と照明のテキストによる制御; そして分布外に外挿する行動制御——自車を車線外に操舵させる、専門家データでは一度も見られなかった状況でも、幾何的に正確なシーンと反応的なエージェント(対向車が衝突を避けるよう操作する)が得られる。
SLAMにおける意義
GAIA-1は、自動運転における「シミュレータとしての世界モデル」の型を確立した: 手作りの物理法則と挙動ルール(CARLA式のシミュレータ)の代わりに、力学は生データから学習され、多様な合成学習シナリオを生成するために生成的に問い合わせられる。速度バンプでのピッチ/ロールや一貫した道路レイアウトといった3Dジオメトリの創発的な理解は、純粋に次トークン予測から生じたものである。これはNVIDIA Cosmosのような後続の世界基盤モデルに直接影響を与えた。SLAM研究者にとっては、明示的な計量マップが暗黙的に学習された力学とどのように結びつくべきかという、Spatial AIの中心的な問いを提起する——例えば、SLAMを位置推定に用いつつ、世界モデルが計画のために短期的な未来を想像する、といった形である。