NVIDIA Cosmos

NVIDIA 2025 · 논문

한 줄 요약 — Cosmos는 Physical AI를 위한 NVIDIA의 월드 기반 모델 플랫폼입니다: 자율 주행 차량과 로봇 훈련을 위해 물리적으로 타당한 합성 비디오/센서 데이터를 생성하는 사전 훈련된 생성적 월드 모델, 토크나이저, 파이프라인 모음입니다.

문제

Physical AI는 먼저 디지털로 훈련되어야 합니다 — 자신의 디지털 트윈(정책 모델)과 세계의 디지털 트윈(월드 모델)이 모두 필요합니다. 다양한 실제 센서 데이터, 특히 희귀하고 위험한 시나리오를 수집하는 것은 느리고 안전하지 않으며, 수작업으로 제작된 시뮬레이터는 시뮬-실제 격차를 겪습니다. Cosmos 기술 보고서(arXiv:2501.03575)는 월드 기반 모델(WFM) — 시각적 세계가 어떻게 전개되는지에 대한 범용적인 사전 훈련된 생성 모델 — 을 개발자가 자신의 Physical AI 설정을 위해 맞춤형 월드 모델로 미세 조정할 수 있는 공유 인프라로 위치시킵니다.

방법 및 아키텍처

이 플랫폼은 다섯 가지 주요 구성 요소를 가집니다: 비디오 큐레이터, 비디오 토크나이저, 사전 훈련된 WFM, 사후 훈련 예제, 가드레일.

L(Dθ,σ)=Ex0,n[Dθ(x0+n;σ)x022]\mathcal{L}(D_\theta,\sigma) = \mathbb{E}_{\mathbf{x}_0,\mathbf{n}}\Big[\big\lVert D_\theta(\mathbf{x}_0+\mathbf{n};\sigma) - \mathbf{x}_0 \big\rVert_2^2\Big]

여기서 x0pdata\mathbf{x}_0 \sim p_{\rm data}, nN(0,σ2I)\mathbf{n} \sim \mathcal{N}(\mathbf{0},\sigma^2\mathbf{I}), 그리고 노이즈 레벨에 대한 학습된 불확실성 가중치 u(σ)u(\sigma)가 추가됩니다. 텍스트 조건화는 T5-XXL을 사용하며; AdaLN-LoRA는 DiT 스타일의 적응형 레이어 정규화를 압축하여, 동일한 품질에서 7B 모델을 11B 매개변수에서 축소합니다.

LNLL=ilogP(viv1,v2,,vi1;Θ)\mathcal{L}_{NLL} = \sum_i -\log P(v_i \mid v_1, v_2, \dots, v_{i-1}; \Theta)

텍스트를 위한 선택적 T5 교차 어텐션이 포함됩니다. 7B 확산 디코더가 이산 토큰을 연속 토큰 공간으로 다시 매핑하여 양자화 아티팩트를 제거하며; Medusa 추측 디코딩은 최대 3.2배의 토큰 처리량을 제공하고, 저해상도 적응은 실시간 10 FPS 생성에 도달합니다.

실험 결과

Cosmos Tokenizer는 DAVIS 비디오에서 약 +4 dB PSNR 재구성으로 이전 토크나이저를 큰 차이로 능가하며, 최대 12배 빠르게 실행되고, 단일 A100 80GB에서 최대 8초 길이의 1080p 비디오를 한 번에 인코딩합니다. WFM 평가는 3D 일관성과 물리 정합성에 초점을 맞춥니다: RealEstate10K의 500개 정적 장면 비디오에서, Cosmos-Predict1-7B-Text2World는 Sampson 에피폴라 오차 0.355를 달성하며(VideoLDM 기준선의 0.841 대비), 카메라 포즈 추정 성공률은 62.6%(Video2World는 68.4%)로 4.4% 대비 우수합니다 — 실제 비디오는 0.431과 56.4%를 기록합니다 — 그리고 3DGS 기반 새로운 시점 합성 PSNR은 33.02로 26.23(실제: 35.38) 대비 우수합니다, 즉 생성된 세계는 실제 비디오에 가까운 수준으로 기하학적으로 일관됩니다. 카메라 제어 미세 조정 모델은 FID/FVD에서 CamCo를 상회하며, 명령된 궤적에 대한 SfM 재추정 궤적의 회전/이동 오차에서도 우수합니다. 모델과 코드는 NVIDIA Open Model License 하에 오픈 웨이트/오픈소스로 공개됩니다.

SLAM에서의 의미

Cosmos는 GAIA-1과 같은 시스템이 개척한 월드 모델 아이디어의 산업화를 대표합니다: Physical AI를 위한 수직적으로 통합된 하드웨어, 시뮬레이션(Omniverse), 기반 모델입니다. 놀랍게도 그 핵심 평가는 순수한 다중 시점 기하학입니다 — Sampson 오차, SfM 포즈 추정 성공률, 3DGS 시점 합성 — 바로 SLAM의 도구 모음이며, 여기서는 생성 모델을 “월드 시뮬레이터”로 평가하는 데 사용됩니다. SLAM에서는 훈련 데이터 생성(학습된 SLAM 구성 요소를 위한 합성 다중 센서 시퀀스)과, 기하학적으로 일관된 상상된 장면의 학습된 렌더러처럼 동작하는 포즈 조건부 Video2World 모델이 직접적으로 관련됩니다.

관련 문서