Sora / DiT

OpenAI 2024 · 논문

한 줄 요약 — Sora는 비디오의 시공간 패치에 대해 확산 Transformer(DiT) 아키텍처를 스케일업하여 텍스트로부터 길고 시간적으로 일관된 비디오를 생성하며, 그 출력은 창발적인 3D 일관성을 보여주어 대규모 비디오 생성이 암묵적으로 장면 기하를 학습함을 시사합니다.

문제

여기서 두 가지 문제가 만납니다. 첫째, 이미지 확산 모델은 스케일링 거동이 잘 이해되지 않은 합성곱 U-Net 백본 위에 구축되어 있었습니다; DiT(Peebles와 Xie, “Scalable Diffusion Models with Transformers”, arXiv:2212.09748)는 잠재 패치에 대한 단순한 Transformer가 노이즈 제거기 역할을 하며 다른 곳의 Transformer들처럼 스케일링될 수 있는지를 물었습니다. 둘째, 비디오 생성기는 고정된 해상도와 길이의 짧은 클립에 제한되어 있었습니다. OpenAI의 텍스트-투-비디오 시스템인 Sora는 DiT 스타일 백본과 인터넷 규모로 훈련된 통합 비디오 표현을 결합하며, OpenAI는 이를 명시적으로 “월드 시뮬레이터”를 향한 한 걸음으로 규정합니다.

방법 및 아키텍처

DiT 논문은 잠재 확산 모델(LDM) 프레임워크에서 작동합니다: 동결된 VAE 인코더 EE256×256×3256\times 256\times 3 이미지를 32×32×432\times 32\times 4 형태의 잠재 z=E(x)z = E(x)로 매핑하고, 확산 모델은 그 잠재 공간에서 훈련됩니다. 파이프라인은 다음과 같습니다:

Lsimple(θ)=ϵθ(xt)ϵt22\mathcal{L}_{simple}(\theta) = \lVert \epsilon_\theta(x_t) - \epsilon_t \rVert_2^2

한편 역방향 과정의 공분산 Σθ\Sigma_\theta는 전체 KL 항으로 훈련되며; 선형 디코더가 각 토큰을 p×p×2Cp\times p\times 2C 형태의 노이즈-및-공분산 예측으로 되돌립니다.

실험 결과

DiT의 핵심 발견은 모델의 Gflops와 FID-50K 사이의 강한 음의 상관관계입니다: 12개 모델(S/B/L/XL 구성, 클래스 조건부 ImageNet에서 패치 크기 8/4/2)에 걸쳐, 깊이/너비 또는 토큰 수를 늘리면 FID가 일관되게 개선되며, 총 Gflops가 비슷한 모델(예: DiT-S/2와 DiT-B/4)은 비슷한 FID에 도달합니다 — 매개변수 수가 아니라 계산량이 중요합니다. adaLN-Zero는 모든 훈련 단계에서 교차 주의와 인-컨텍스트 조건화를 능가합니다; 40만 이터레이션 시점에서 그 FID는 인-컨텍스트 변형의 거의 절반입니다. 700만 스텝 훈련한 DiT-XL/2(118.6 Gflops)는 분류기 프리 가이던스를 사용해 클래스 조건부 ImageNet 256×256에서 FID 2.27을 달성하여, 이전 최고 확산 FID인 3.60(LDM)과 이전 최신 기법인 StyleGAN-XL을 넘어서며, 픽셀 공간 U-Net(ADM: 1120 Gflops)보다 순전파당 훨씬 저렴합니다; 512×512에서도 최신 기법이며, 235만 스텝에서 이미 FID 2.55에 도달합니다. Sora 자체는 기술 보고서와 제품 형태로만 공개되어 정성적 결과만 존재합니다 — 길고, 고화질이며, 시간적으로 일관되고, 창발적인 3D 일관성과 객체 영속성을 갖는 비디오입니다; 전체 시연은 OpenAI의 보고서를 참조하십시오.

SLAM에서의 의미

Sora는 인터넷 규모의 비디오 훈련이 어떠한 3D 지도 없이도 암묵적인 3D 장면 이해를 낳는다는 가장 강력한 공개적 증거입니다 — 이는 GAIA-1이 주행 환경에서 관찰한 것과 동일한 창발적 속성입니다. 이는 SLAM에 두 방향으로 중요합니다: DiT 스타일 생성 모델은 체화된 시스템을 훈련하기 위한 데이터를 합성하는 월드 기반 모델(Cosmos와 그 후속 모델들)의 엔진이 되어가고 있으며, “비디오 생성기 내부의 3D 지식을 명시적이고 미터법적으로 일관된 맵으로 추출할 수 있는가?”라는 질문은 이제 SLAM-생성 AI 인터페이스에서 살아 있는 연구 프론티어입니다. NVIDIA Cosmos는 심지어 자신의 확산 월드 모델에서 (LoRA와 함께) DiT의 adaLN 레이어를 채택하고 있습니다.

관련 문서