레벨 11 / 11

월드 모델 및 공간 AI

SLAM 지도에서 학습된 월드 표현으로

핵심 개념

월드 모델

시스템 저자/연도 핵심 개념
GAIA-1 Wayve 2023 주행 월드 모델, 행동 조건화 미래 장면 생성
Sora / DiT OpenAI 2024 Diffusion Transformer, 시공간 패치, 창발적 3D 이해
NVIDIA Cosmos NVIDIA 2025 Physical AI를 위한 월드 파운데이션 모델 플랫폼, 자율주행차/로봇을 위한 합성 데이터
World Labs / Marble Fei-Fei Li 2025 이미지/비디오/텍스트 프롬프트로부터 생성적 3D 세계(영속적인 가우시안 스플랫 장면) 생성
WorldVLA Cen (Alibaba) 2025 자기회귀 행동 월드 모델, 행동 생성을 위한 물리 법칙 학습
SceneDINO Jevtić 2025 피드포워드 비지도 시맨틱 장면 완성

생성적 3D

시스템 저자/연도 핵심 개념
DreamFusion Poole 2023 Score Distillation Sampling(SDS) + NeRF를 통한 텍스트-투-3D

비전-언어 모델 (VLM)

시스템 저자/연도 핵심 개념
CLIP Radford (OpenAI) 2021 대조적 이미지-텍스트 사전학습, 4억 쌍, 제로샷
SigLIP Zhai (Google) 2023 시그모이드 손실 기반 CLIP, 더 효율적, 작은 모델 크기에서 더 우수
BLIP-2 Li (Salesforce) 2023 Q-Former가 고정된 LLM과 이미지 인코더를 연결
LLaVA Liu 2023 LLaMA + 비전, 대화형 VLM

비전-언어-행동 모델 (VLA)

시스템 저자/연도 핵심 개념
RT-2 Brohan (DeepMind) 2023 텍스트 토큰으로서의 로봇 행동, 창발적 일반화
OpenVLA Kim 2024 오픈소스 VLA, SigLIP + Llama 7B + Action Head
NaVILA Cheng 2024 내비게이션을 위한 다리형/바퀴형 로봇 비전-언어-행동 모델

자료

자료 저자/연도 핵심 개념
Awesome-Transformer-based-SLAM KwanWaiPang Transformer 기반 SLAM 방법론을 정리한 GitHub 목록