第 11 级 / 11

世界模型与空间智能

从SLAM地图到学习型世界表征

关键概念

世界模型

系统 作者/年份 关键概念
GAIA-1 Wayve 2023 驾驶世界模型,动作条件下的未来场景生成
Sora / DiT OpenAI 2024 扩散Transformer,时空图像块(spacetime patches),涌现出的3D理解能力
NVIDIA Cosmos NVIDIA 2025 面向物理AI的世界基础模型平台,为自动驾驶/机器人生成合成数据
World Labs / Marble Fei-Fei Li 2025 从图像/视频/文本提示生成生成式3D世界(持久化的高斯溅射场景)
WorldVLA Cen (Alibaba) 2025 自回归动作世界模型,为动作生成学习物理规律
SceneDINO Jevtić 2025 前馈式无监督语义场景补全

生成式3D

系统 作者/年份 关键概念
DreamFusion Poole 2023 通过分数蒸馏采样(SDS)+NeRF实现文本生成3D

视觉-语言模型(VLM)

系统 作者/年份 关键概念
CLIP Radford (OpenAI) 2021 对比图文预训练,4亿图文对,零样本
SigLIP Zhai (Google) 2023 Sigmoid损失版CLIP,更高效,在较小模型规模下表现更好
BLIP-2 Li (Salesforce) 2023 Q-Former连接冻结的LLM与图像编码器
LLaVA Liu 2023 LLaMA+视觉,对话式VLM

视觉-语言-动作模型(VLA)

系统 作者/年份 关键概念
RT-2 Brohan (DeepMind) 2023 将机器人动作表示为文本token,涌现出的泛化能力
OpenVLA Kim 2024 开源VLA,SigLIP+Llama 7B+动作头
NaVILA Cheng 2024 面向导航的腿式/轮式机器人视觉-语言-动作模型

资料

资料 作者/年份 关键概念
Awesome-Transformer-based-SLAM KwanWaiPang 基于Transformer的SLAM方法GitHub精选列表