GAIA-1

Wayve 2023 · 论文

一句话总结 — GAIA-1(“面向自主性的生成式人工智能”)是一个生成式世界模型,接收视频、文本和自车动作作为输入,生成对自车行为具有精细控制能力的逼真未来驾驶场景,并从原始驾驶数据中学习道路行为的隐含规则。

问题

构建能够安全应对真实世界场景的非结构化复杂性的自动驾驶系统仍然困难,其中一个关键子问题是预测:随着世界的演变,预判车辆动作可能引发的各种潜在结果。此前的世界模型依赖标注数据或低维仿真表示,无法生成复杂真实场景的逼真样本,而视频生成模型能产出逼真的像素,却对演化中的世界动态表示得很弱。GAIA-1 力图兼取两者之长:生成式视频模型的可扩展性与真实感,以及世界模型对未来的有意义表示。

方法与架构

GAIA-1 有三个可训练组件:一个图像分词器、一个自回归世界模型和一个视频扩散解码器。

Lworld model=t=1Ti=1nlogp(zt,iz<t,  zt,j<i,  ct,  a<t)L_{\text{world model}} = -\sum_{t=1}^{T}\sum_{i=1}^{n} \log p\big(z_{t,i} \mid \mathbf{z}_{<t},\; z_{t,j<i},\; \mathbf{c}_{\leq t},\; \mathbf{a}_{<t}\big)

其中 zt,iz_{t,i} 是图像词元,c\mathbf{c} 是文本词元,a\mathbf{a} 是动作词元。条件丢弃(无条件/动作条件/文本条件分别以 20%/40%/40% 的比例)使单个模型同时具备无条件生成、动作条件生成和文本条件生成的能力。

Lvideo=Eϵ,t[ϵθ(xt,t,z,m)ϵ22]L_{\text{video}} = \mathbb{E}_{\epsilon, t'}\Big[\big\lVert \epsilon_\theta(\mathbf{x}^{t'}, t', \mathbf{z}, \mathbf{m}) - \epsilon \big\rVert_2^2\Big]

其中 xt=αtx+σtϵ\mathbf{x}^{t'} = \alpha_{t'}\mathbf{x} + \sigma_{t'}\epsilon 是加噪视频,z\mathbf{z} 是条件图像词元,m\mathbf{m} 是任务特定掩码。它将词元渲染为像素,并将时间分辨率由 6.25 Hz 逐步上采样到 12.5 Hz、再到 25 Hz(DDIM,50 步),出于稳定性考虑从最后几帧开始反向解码。

实验结果

在 4,700 小时的私有伦敦城市驾驶数据(2019–2023 年,25 Hz,约 4.2 亿张图像)上训练,并采用特征平衡采样;验证集为 400 小时的严格地理围栏留出数据。世界模型在 64 块 A100 80GB GPU 上训练 100k 步,耗时 15 天;解码器在 32 块 A100 上训练 300k 步。GAIA-1 遵循类似 LLM 的缩放定律:对参数量从 0.65M 到 650M 的模型拟合幂律 f(x)=c+(x/a)bf(x) = c + (x/a)^{b}(每词元计算量 C=6NC=6N),能够以不到 20×20\times 的计算量准确预测最终 6.5B 模型的验证集交叉熵,外推结果表明更多数据和计算量仍有大量提升空间。所展示的能力均为定性结果(未报告标准基准数值):稳定的数分钟长的完全想象驾驶;从单个视频提示生成多个合理的未来(让行交互、环岛选择、变化的交通状况);通过文本控制天气和光照;以及超出分布的动作控制外推——强制自车驶出车道,这在专家数据中从未出现,却能生成几何上准确的场景以及做出反应的智能体(对向车辆会做出规避动作以避免碰撞)。

对SLAM的意义

GAIA-1 确立了自动驾驶中“世界模型作为仿真器”的范式:动态特性不再是手工编写的物理规则和行为规则(CARLA 式仿真器),而是从原始数据中学习并通过生成式方式查询,从而产生多样化的合成训练场景。其对三维几何的涌现式理解(过减速带时的俯仰/横滚、一致的道路布局)纯粹来自下一词元预测。它直接启发了后续的世界基础模型,例如 NVIDIA Cosmos。对 SLAM 研究者而言,它提出了 Spatial AI 的核心问题:显式度量地图应如何与隐式学习到的动态模型相连接——例如,用 SLAM 进行定位,同时让世界模型为规划想象短时程的未来。

相关条目