NVIDIA Cosmos

NVIDIA 2025 · 論文

一行要約 — CosmosはPhysical AIのためのNVIDIAのWorld Foundation Modelプラットフォームであり、自動運転車とロボットの学習のために物理的に妥当な合成動画/センサーデータを生成する、事前学習済み生成的世界モデル、トークナイザ、パイプラインのスイートである。

問題

Physical AIは、まずデジタルに学習される必要がある——自分自身のデジタルツイン(ポリシーモデル)と、世界のデジタルツイン(世界モデル)が必要である。多様な実センサーデータ、特に稀で危険なシナリオを収集するのは遅く安全性に欠ける一方、手作りのシミュレータはsim-to-realギャップに悩まされる。Cosmosの技術報告書(arXiv:2501.03575)は、world foundation model(WFM)——視覚的な世界がどのように進展するかについての、汎用的で事前学習された生成モデル——を、開発者が自身のPhysical AI用途向けにカスタムの世界モデルへとファインチューニングするための共有インフラとして位置づける。

手法とアーキテクチャ

このプラットフォームには5つの主要なコンポーネントがある: 動画キュレータ、動画トークナイザ、事前学習済みWFM、事後学習の例、そしてガードレールである。

L(Dθ,σ)=Ex0,n[Dθ(x0+n;σ)x022]\mathcal{L}(D_\theta,\sigma) = \mathbb{E}_{\mathbf{x}_0,\mathbf{n}}\Big[\big\lVert D_\theta(\mathbf{x}_0+\mathbf{n};\sigma) - \mathbf{x}_0 \big\rVert_2^2\Big]

ここで x0pdata\mathbf{x}_0 \sim p_{\rm data}nN(0,σ2I)\mathbf{n} \sim \mathcal{N}(\mathbf{0},\sigma^2\mathbf{I}) であり、さらにノイズレベルにわたる学習された不確実性重み付け u(σ)u(\sigma) が加わる。テキスト条件付けにはT5-XXLを用い、AdaLN-LoRAはDiT式の適応的レイヤー正規化を圧縮し、7Bモデルを同等の品質のまま11Bパラメータから削減する。

LNLL=ilogP(viv1,v2,,vi1;Θ)\mathcal{L}_{NLL} = \sum_i -\log P(v_i \mid v_1, v_2, \dots, v_{i-1}; \Theta)

テキスト用の任意のT5クロスアテンションを備える。7Bの拡散デコーダが離散トークンを連続トークン空間に戻すことで量子化アーティファクトを除去する; Medusa投機的デコーディングにより最大3.2倍のトークンスループットが得られ、低解像度への適応によりリアルタイムの10FPS生成が可能になる。

実験結果

Cosmos Tokenizerは、従来のトークナイザを大きく上回る——DAVIS動画で約+4dB PSNRの再構成品質、最大12倍の高速化、単一のA100 80GBで最大8秒の1080p動画を一度にエンコードできる。WFMの評価は3D一貫性と物理的整合性に注目する: RealEstate10Kからの500本の静的シーン動画において、Cosmos-Predict1-7B-Text2WorldはSampsonエピポーラ誤差0.355を達成する(VideoLDMベースラインの0.841に対して)。カメラ姿勢推定の成功率は62.6%(Video2Worldでは68.4%)であり、これはベースラインの4.4%に対するものである——実動画のスコアはそれぞれ0.431と56.4%である——そして3DGSベースの新規ビュー合成PSNRは33.02であり、これは26.23に対するものである(実動画: 35.38)。つまり、生成された世界は実際の動画に近いレベルで幾何的に一貫している。カメラ制御のファインチューンは、FID/FVD、そしてSfMで再推定された軌跡とコマンドされた軌跡との回転/移動誤差においてCamCoを上回る。モデルとコードは、NVIDIA Open Model Licenseの下でオープンウェイト/オープンソースとして公開されている。

SLAMにおける意義

Cosmosは、GAIA-1のようなシステムが先駆けとなった世界モデルというアイデアの産業化を代表する: Physical AIのために垂直統合されたハードウェア、シミュレーション(Omniverse)、基盤モデルである。印象的なのは、その主要な評価が純粋な多視点ジオメトリであることだ——Sampson誤差、SfMによる姿勢推定の成功率、3DGSのビュー合成——これらはまさにSLAMの道具立てであり、ここでは生成モデルを「世界シミュレータ」として採点するために用いられている。SLAMにとっての直接的な関連性は、学習データの生成(学習済みSLAMコンポーネントのための合成マルチセンサー系列)と、想像上でありながら幾何的に一貫したシーンの学習済みレンダラーのように振る舞う姿勢条件付きVideo2Worldモデルである。

関連ノート