Sora / DiT
OpenAI 2024 · 논문
한 줄 요약 — Sora는 비디오의 시공간 패치에 대해 확산 Transformer(DiT) 아키텍처를 스케일업하여 텍스트로부터 길고 시간적으로 일관된 비디오를 생성하며, 그 출력은 창발적인 3D 일관성을 보여주어 대규모 비디오 생성이 암묵적으로 장면 기하를 학습함을 시사합니다.
문제
여기서 두 가지 문제가 만납니다. 첫째, 이미지 확산 모델은 스케일링 거동이 잘 이해되지 않은 합성곱 U-Net 백본 위에 구축되어 있었습니다; DiT(Peebles와 Xie, “Scalable Diffusion Models with Transformers”, arXiv:2212.09748)는 잠재 패치에 대한 단순한 Transformer가 노이즈 제거기 역할을 하며 다른 곳의 Transformer들처럼 스케일링될 수 있는지를 물었습니다. 둘째, 비디오 생성기는 고정된 해상도와 길이의 짧은 클립에 제한되어 있었습니다. OpenAI의 텍스트-투-비디오 시스템인 Sora는 DiT 스타일 백본과 인터넷 규모로 훈련된 통합 비디오 표현을 결합하며, OpenAI는 이를 명시적으로 “월드 시뮬레이터”를 향한 한 걸음으로 규정합니다.
방법 및 아키텍처
DiT 논문은 잠재 확산 모델(LDM) 프레임워크에서 작동합니다: 동결된 VAE 인코더 가 이미지를 형태의 잠재 로 매핑하고, 확산 모델은 그 잠재 공간에서 훈련됩니다. 파이프라인은 다음과 같습니다:
- 패치화: 형태 의 노이즈가 섞인 잠재를 크기 의 패치로 자르고 너비 의 개 토큰 시퀀스로 선형 임베딩하며, ViT의 사인-코사인 위치 임베딩을 사용합니다. 를 절반으로 줄이면 토큰 수(및 Gflops)는 4배가 되지만 매개변수 수는 본질적으로 변하지 않습니다.
- DiT 블록: 네 가지 구성(DiT-S/B/L/XL, 0.3에서 118.6 Gflops에 걸침)으로 이루어진 표준 Transformer 블록 개의 스택입니다. 확산 시간 단계 와 클래스 에 대한 조건화는 네 가지 설계 — 인-컨텍스트 토큰, 교차 주의(약 15%의 Gflops 오버헤드), 적응형 레이어 정규화(adaLN), 그리고 adaLN-Zero — 로 비교됩니다: 스케일/이동 매개변수 와 블록별 잔차 게이트 가 와 의 임베딩으로부터 회귀되며, 는 0으로 초기화되어 모든 블록이 항등 함수로 시작합니다.
- 훈련 목적 함수: 표준 DDPM 노이즈 예측입니다. 순방향 과정 , 가 주어지면, 노이즈 제거기는 다음을 최소화합니다.
한편 역방향 과정의 공분산 는 전체 KL 항으로 훈련되며; 선형 디코더가 각 토큰을 형태의 노이즈-및-공분산 예측으로 되돌립니다.
- 분류기 프리 가이던스: , 가이던스 스케일 .
- Sora(OpenAI의 기술 보고서 기준; 수식을 포함한 논문은 존재하지 않음): 비디오는 시각 인코더에 의해 시공간 잠재로 압축된 후 시공간 패치 토큰 — DiT의 패치화에 대응하는 비디오 버전 — 으로 잘리며, 이로써 하나의 균일한 토큰 형식이 만들어져 단일 모델이 가변 길이, 가변 해상도, 가변 화면비의 비디오에 대해 훈련하고 생성할 수 있게 됩니다.
실험 결과
DiT의 핵심 발견은 모델의 Gflops와 FID-50K 사이의 강한 음의 상관관계입니다: 12개 모델(S/B/L/XL 구성, 클래스 조건부 ImageNet에서 패치 크기 8/4/2)에 걸쳐, 깊이/너비 또는 토큰 수를 늘리면 FID가 일관되게 개선되며, 총 Gflops가 비슷한 모델(예: DiT-S/2와 DiT-B/4)은 비슷한 FID에 도달합니다 — 매개변수 수가 아니라 계산량이 중요합니다. adaLN-Zero는 모든 훈련 단계에서 교차 주의와 인-컨텍스트 조건화를 능가합니다; 40만 이터레이션 시점에서 그 FID는 인-컨텍스트 변형의 거의 절반입니다. 700만 스텝 훈련한 DiT-XL/2(118.6 Gflops)는 분류기 프리 가이던스를 사용해 클래스 조건부 ImageNet 256×256에서 FID 2.27을 달성하여, 이전 최고 확산 FID인 3.60(LDM)과 이전 최신 기법인 StyleGAN-XL을 넘어서며, 픽셀 공간 U-Net(ADM: 1120 Gflops)보다 순전파당 훨씬 저렴합니다; 512×512에서도 최신 기법이며, 235만 스텝에서 이미 FID 2.55에 도달합니다. Sora 자체는 기술 보고서와 제품 형태로만 공개되어 정성적 결과만 존재합니다 — 길고, 고화질이며, 시간적으로 일관되고, 창발적인 3D 일관성과 객체 영속성을 갖는 비디오입니다; 전체 시연은 OpenAI의 보고서를 참조하십시오.
SLAM에서의 의미
Sora는 인터넷 규모의 비디오 훈련이 어떠한 3D 지도 없이도 암묵적인 3D 장면 이해를 낳는다는 가장 강력한 공개적 증거입니다 — 이는 GAIA-1이 주행 환경에서 관찰한 것과 동일한 창발적 속성입니다. 이는 SLAM에 두 방향으로 중요합니다: DiT 스타일 생성 모델은 체화된 시스템을 훈련하기 위한 데이터를 합성하는 월드 기반 모델(Cosmos와 그 후속 모델들)의 엔진이 되어가고 있으며, “비디오 생성기 내부의 3D 지식을 명시적이고 미터법적으로 일관된 맵으로 추출할 수 있는가?”라는 질문은 이제 SLAM-생성 AI 인터페이스에서 살아 있는 연구 프론티어입니다. NVIDIA Cosmos는 심지어 자신의 확산 월드 모델에서 (LoRA와 함께) DiT의 adaLN 레이어를 채택하고 있습니다.