NVIDIA Cosmos
NVIDIA 2025 · 論文
一行要約 — CosmosはPhysical AIのためのNVIDIAのWorld Foundation Modelプラットフォームであり、自動運転車とロボットの学習のために物理的に妥当な合成動画/センサーデータを生成する、事前学習済み生成的世界モデル、トークナイザ、パイプラインのスイートである。
問題
Physical AIは、まずデジタルに学習される必要がある——自分自身のデジタルツイン(ポリシーモデル)と、世界のデジタルツイン(世界モデル)が必要である。多様な実センサーデータ、特に稀で危険なシナリオを収集するのは遅く安全性に欠ける一方、手作りのシミュレータはsim-to-realギャップに悩まされる。Cosmosの技術報告書(arXiv:2501.03575)は、world foundation model(WFM)——視覚的な世界がどのように進展するかについての、汎用的で事前学習された生成モデル——を、開発者が自身のPhysical AI用途向けにカスタムの世界モデルへとファインチューニングするための共有インフラとして位置づける。
手法とアーキテクチャ
このプラットフォームには5つの主要なコンポーネントがある: 動画キュレータ、動画トークナイザ、事前学習済みWFM、事後学習の例、そしてガードレールである。
- データキュレーション: Rayで統括されたパイプライン(分割、フィルタリング、注釈付け、重複除去、シャーディング)が、2000万時間の生動画コレクションから約1億本のクリップ(2〜60秒)を抽出する; VLMが256フレームごとに各クリップにキャプションを付ける。おおよそ 本のクリップが事前学習に、 本がファインチューニングに用いられる。すべてのWFMは、1万基のH100 GPUのクラスタで3ヶ月かけて学習された。
- Cosmos Tokenizer: 2レベルのウェーブレット空間で動作する時間的因果エンコーダ-デコーダで、時空間に因数分解された畳み込みと因果的自己注意から構築される。因果性により、単一のネットワークが画像と動画の両方をトークン化でき、Physical AIの因果的な設定に一致する。連続トークナイザはバニラなオートエンコーダの潜在表現(次元16)を用いる; 離散トークナイザは、レベル のFinite-Scalar Quantization、すなわち64,000語の語彙を用いる。
- 拡散WFMファミリー: 連続CV8×8×8トークン上の潜在動画拡散モデルであり、Text2World(7B、14B)とVideo2World(過去のフレームとテキストプロンプトから未来の動画を予測するようファインチューニングされた変種)の形態を持つ。学習はEDMのノイズ除去スコアマッチングに従う——ノイズレベル において、デノイザ は次を最小化する
ここで 、 であり、さらにノイズレベルにわたる学習された不確実性重み付け が加わる。テキスト条件付けにはT5-XXLを用い、AdaLN-LoRAはDiT式の適応的レイヤー正規化を圧縮し、7Bモデルを同等の品質のまま11Bパラメータから削減する。
- 自己回帰WFMファミリー: 離散DV8×16×16トークンに対して次トークン予測を行うLlama3式トランスフォーマー(4B、12B)であり、
テキスト用の任意のT5クロスアテンションを備える。7Bの拡散デコーダが離散トークンを連続トークン空間に戻すことで量子化アーティファクトを除去する; Medusa投機的デコーディングにより最大3.2倍のトークンスループットが得られ、低解像度への適応によりリアルタイムの10FPS生成が可能になる。
- 事後学習の例: カメラ制御付きVideo2World(学習された姿勢条件付きレンダラー)、ロボット操作(指示と行動に条件付けられた予測)、そしてベースWFMからファインチューニングされたマルチビュー自動運転モデルである。
実験結果
Cosmos Tokenizerは、従来のトークナイザを大きく上回る——DAVIS動画で約+4dB PSNRの再構成品質、最大12倍の高速化、単一のA100 80GBで最大8秒の1080p動画を一度にエンコードできる。WFMの評価は3D一貫性と物理的整合性に注目する: RealEstate10Kからの500本の静的シーン動画において、Cosmos-Predict1-7B-Text2WorldはSampsonエピポーラ誤差0.355を達成する(VideoLDMベースラインの0.841に対して)。カメラ姿勢推定の成功率は62.6%(Video2Worldでは68.4%)であり、これはベースラインの4.4%に対するものである——実動画のスコアはそれぞれ0.431と56.4%である——そして3DGSベースの新規ビュー合成PSNRは33.02であり、これは26.23に対するものである(実動画: 35.38)。つまり、生成された世界は実際の動画に近いレベルで幾何的に一貫している。カメラ制御のファインチューンは、FID/FVD、そしてSfMで再推定された軌跡とコマンドされた軌跡との回転/移動誤差においてCamCoを上回る。モデルとコードは、NVIDIA Open Model Licenseの下でオープンウェイト/オープンソースとして公開されている。
SLAMにおける意義
Cosmosは、GAIA-1のようなシステムが先駆けとなった世界モデルというアイデアの産業化を代表する: Physical AIのために垂直統合されたハードウェア、シミュレーション(Omniverse)、基盤モデルである。印象的なのは、その主要な評価が純粋な多視点ジオメトリであることだ——Sampson誤差、SfMによる姿勢推定の成功率、3DGSのビュー合成——これらはまさにSLAMの道具立てであり、ここでは生成モデルを「世界シミュレータ」として採点するために用いられている。SLAMにとっての直接的な関連性は、学習データの生成(学習済みSLAMコンポーネントのための合成マルチセンサー系列)と、想像上でありながら幾何的に一貫したシーンの学習済みレンダラーのように振る舞う姿勢条件付きVideo2Worldモデルである。