NVIDIA Cosmos
NVIDIA 2025 · 논문
한 줄 요약 — Cosmos는 Physical AI를 위한 NVIDIA의 월드 기반 모델 플랫폼입니다: 자율 주행 차량과 로봇 훈련을 위해 물리적으로 타당한 합성 비디오/센서 데이터를 생성하는 사전 훈련된 생성적 월드 모델, 토크나이저, 파이프라인 모음입니다.
문제
Physical AI는 먼저 디지털로 훈련되어야 합니다 — 자신의 디지털 트윈(정책 모델)과 세계의 디지털 트윈(월드 모델)이 모두 필요합니다. 다양한 실제 센서 데이터, 특히 희귀하고 위험한 시나리오를 수집하는 것은 느리고 안전하지 않으며, 수작업으로 제작된 시뮬레이터는 시뮬-실제 격차를 겪습니다. Cosmos 기술 보고서(arXiv:2501.03575)는 월드 기반 모델(WFM) — 시각적 세계가 어떻게 전개되는지에 대한 범용적인 사전 훈련된 생성 모델 — 을 개발자가 자신의 Physical AI 설정을 위해 맞춤형 월드 모델로 미세 조정할 수 있는 공유 인프라로 위치시킵니다.
방법 및 아키텍처
이 플랫폼은 다섯 가지 주요 구성 요소를 가집니다: 비디오 큐레이터, 비디오 토크나이저, 사전 훈련된 WFM, 사후 훈련 예제, 가드레일.
- 데이터 큐레이션: Ray로 오케스트레이션된 파이프라인(분할, 필터링, 주석, 중복 제거, 샤딩)이 2천만 시간 규모의 원시 비디오 컬렉션에서 약 1억 개의 클립(2–60초)을 추출합니다; VLM이 256 프레임마다 각 클립에 캡션을 붙입니다. 대략 개의 클립이 사전 훈련에, 개가 미세 조정에 사용됩니다. 모든 WFM은 10,000개의 H100 GPU 클러스터에서 3개월에 걸쳐 훈련되었습니다.
- Cosmos Tokenizer: 시공간적으로 인수분해된 합성곱과 인과적 자기 어텐션으로 구성된, 2단계 웨이블릿 공간에서 동작하는 시간적으로 인과적인 인코더-디코더입니다. 인과성은 단일 네트워크가 이미지와 비디오를 모두 토큰화하고 Physical AI의 인과적 설정과 일치하게 함을 의미합니다. 연속 토크나이저는 일반적인 오토인코더 잠재 변수를 사용하고(차원 16); 이산 토크나이저는 레벨 의 유한 스칼라 양자화, 즉 64,000개의 어휘를 사용합니다.
- 확산 WFM 계열: 연속적인 CV8×8×8 토큰에 대한 잠재 비디오 확산 모델로, Text2World(7B, 14B)와 Video2World 변형(과거 프레임과 텍스트 프롬프트로부터 미래 비디오를 예측하도록 미세 조정됨)이 있습니다. 훈련은 EDM 노이즈 제거 점수 매칭을 따릅니다 — 노이즈 레벨 에서 노이즈 제거기 는 다음을 최소화합니다
여기서 , , 그리고 노이즈 레벨에 대한 학습된 불확실성 가중치 가 추가됩니다. 텍스트 조건화는 T5-XXL을 사용하며; AdaLN-LoRA는 DiT 스타일의 적응형 레이어 정규화를 압축하여, 동일한 품질에서 7B 모델을 11B 매개변수에서 축소합니다.
- 자기회귀 WFM 계열: 이산 DV8×16×16 토큰에 대해 다음 토큰 예측을 수행하는 Llama3 스타일 Transformer(4B, 12B)입니다,
텍스트를 위한 선택적 T5 교차 어텐션이 포함됩니다. 7B 확산 디코더가 이산 토큰을 연속 토큰 공간으로 다시 매핑하여 양자화 아티팩트를 제거하며; Medusa 추측 디코딩은 최대 3.2배의 토큰 처리량을 제공하고, 저해상도 적응은 실시간 10 FPS 생성에 도달합니다.
- 사후 훈련 예제: 카메라 제어 Video2World(학습된 포즈 조건부 렌더러), 로봇 조작(명령 및 행동 조건부 예측), 기본 WFM으로부터 미세 조정된 다중 시점 자율 주행 모델.
실험 결과
Cosmos Tokenizer는 DAVIS 비디오에서 약 +4 dB PSNR 재구성으로 이전 토크나이저를 큰 차이로 능가하며, 최대 12배 빠르게 실행되고, 단일 A100 80GB에서 최대 8초 길이의 1080p 비디오를 한 번에 인코딩합니다. WFM 평가는 3D 일관성과 물리 정합성에 초점을 맞춥니다: RealEstate10K의 500개 정적 장면 비디오에서, Cosmos-Predict1-7B-Text2World는 Sampson 에피폴라 오차 0.355를 달성하며(VideoLDM 기준선의 0.841 대비), 카메라 포즈 추정 성공률은 62.6%(Video2World는 68.4%)로 4.4% 대비 우수합니다 — 실제 비디오는 0.431과 56.4%를 기록합니다 — 그리고 3DGS 기반 새로운 시점 합성 PSNR은 33.02로 26.23(실제: 35.38) 대비 우수합니다, 즉 생성된 세계는 실제 비디오에 가까운 수준으로 기하학적으로 일관됩니다. 카메라 제어 미세 조정 모델은 FID/FVD에서 CamCo를 상회하며, 명령된 궤적에 대한 SfM 재추정 궤적의 회전/이동 오차에서도 우수합니다. 모델과 코드는 NVIDIA Open Model License 하에 오픈 웨이트/오픈소스로 공개됩니다.
SLAM에서의 의미
Cosmos는 GAIA-1과 같은 시스템이 개척한 월드 모델 아이디어의 산업화를 대표합니다: Physical AI를 위한 수직적으로 통합된 하드웨어, 시뮬레이션(Omniverse), 기반 모델입니다. 놀랍게도 그 핵심 평가는 순수한 다중 시점 기하학입니다 — Sampson 오차, SfM 포즈 추정 성공률, 3DGS 시점 합성 — 바로 SLAM의 도구 모음이며, 여기서는 생성 모델을 “월드 시뮬레이터”로 평가하는 데 사용됩니다. SLAM에서는 훈련 데이터 생성(학습된 SLAM 구성 요소를 위한 합성 다중 센서 시퀀스)과, 기하학적으로 일관된 상상된 장면의 학습된 렌더러처럼 동작하는 포즈 조건부 Video2World 모델이 직접적으로 관련됩니다.