World model
世界模型(world model) 是一个学习得到的、关于环境动态的生成模型:给定当前状态(以及可选的动作),它预测接下来会发生什么。用公式表示,它近似的是这样一种形式
其中”状态”可以是原始像素、一个潜在嵌入,或离散 token;“动作”可以是机器人指令、方向盘输入,或者根本没有动作(纯粹的视频预测)。由于该模型可以被滚动展开(rolled out)——把自己的预测再喂给自己,从而向前模拟若干步——它就相当于一个内部模拟器:智能体可以在不接触真实世界、也不依赖手工构建物理引擎的情况下,想象候选动作会带来的后果,并据此进行规划。
谱系:从潜在想象到互联网规模
这一思想有两个源头。在强化学习中,“world models”这一脉络(Ha 与 Schmidhuber 的 World Models,随后是 Dreamer 系列)为特定环境训练一个紧凑的潜在动态模型,并在该模型的想象之中学习行为——在潜在空间中做规划,其代价比在真实环境中行动要低几个数量级。近期这一波浪潮保留了这一概念,但改变了规模和实现机制:现代世界模型建立在与语言和视频生成相同的 token/扩散机制之上,并在互联网规模或车队规模的视频上训练。
- token 化的自回归模型(例如用于自动驾驶的 GAIA-1):视频帧、文本和自车动作被编码为离散 token,并用一个 GPT 风格的 transformer 以下一个 token 预测的方式训练。在推理时改变动作 token 即可回答”如果我在这里刹车会怎样?“——模型无需显式监督即可学到道路拓扑、车道几何以及智能体行为。
- 基于扩散的视频模型(例如建立在 Diffusion Transformer 之上的 Sora):仅以生成合理视频为训练目标,却展现出涌现的三维一致性——物体持久性、连贯的相机运动——这表明大规模生成会迫使模型形成对世界的隐式建模。
- 世界基础模型平台(例如 NVIDIA Cosmos):预训练的预测与迁移模型,旨在作为 Physical AI 的可复用基础设施,包括为训练自动驾驶车辆和机器人生成合成数据。
- 统一的世界模型 + 策略(例如 WorldVLA):动作 token 与未来观测 token 在同一个自回归序列中生成,使策略与动态模型成为同一个网络——在”想象”中的滚动展开可以在执行前对候选动作序列打分,相当于用生成模型做模型预测控制。
所有这些方法背后的核心主张是:动态可以从数据中学习得到——交通行为、接触物理、光照——而不必手工编码,并且只要在足够多的原始视频上训练,模型就能获得关于世界如何演化的结构化知识。
世界模型不是什么
将世界模型与 SLAM 系统构建的地图作对比会很有帮助:
| SLAM 地图 | 世界模型 | |
|---|---|---|
| 编码内容 | 表面/地标在哪里(度量几何) | 世界如何变化(动态) |
| 性质 | 显式,可纠正(回环检测) | 隐式、学习得到、生成式 |
| 优势 | 度量精度高,查询成本低 | 能够预测、想象未曾见过的未来 |
| 劣势 | 假设静态世界,无法预测 | 成本高、容易产生幻觉、度量保证较弱 |
从右侧一列可以引出两条实际的注意事项。第一,幻觉问题:生成模型产生的是看似合理的未来,而非有保证的未来,因此将滚动展开的结果用于安全关键的规划,需要有接地(grounding)手段(而显式地图可以提供这种接地)。第二,成本问题:查询一个 SLAM 地图几乎是免费的;而滚动展开一个数十亿参数的视频模型则代价高昂——这正是为什么提出的混合架构会把世界模型保留给短时程的局部预测。
使用世界模型:通过想象进行规划
其典型用法是配合学习模型的模型预测控制(MPC)。在每个控制步:
- 编码当前观测,得到模型的状态 (token 或潜变量)。
- 采样 条候选动作序列 ,覆盖一个短时程 。
- 滚动展开每一条候选序列,经过模型得到 ——无需与真实世界交互,也无需手工构建的模拟器。
- 依据目标(任务奖励、到目标的距离、碰撞检测)评分每一条想象出的轨迹。
- 执行最佳序列中的第一个动作,观测结果,然后重复上述过程。
这正是 WorldVLA 通过其自回归滚动展开所运行的循环,也是 Dreamer 系列在潜在空间中运行的循环。计划的质量受限于第 3 步的拟真度——这正是为什么当前如此多的研究投入到规模化(GAIA-1、Cosmos)以及将滚动展开结果与显式几何进行接地上。
对SLAM的意义
世界模型与 SLAM 是对互补问题的趋同解答——“我在哪里、这里有什么”对”接下来会发生什么”。一个可能的未来 Spatial AI 技术栈会用 SLAM 完成全局定位和度量精确的建图,同时由一个世界模型处理局部预测与规划(“在我当前地图的锚定下,模拟接下来几秒钟在各候选动作下会发生什么”)。世界模型也在间接地为 SLAM 研究提供助力:它们生成多样化的合成传感器数据,用于训练学习式 SLAM 组件(这正是 Cosmos 一类平台的明确目标),而它们涌现出的三维一致性也提出了活跃的研究问题——一个大型视频模型内部已经隐含了多少”地图”信息?预测与观测之间的失配能否成为几何回环检测的一种学习式替代方案?