GAIA-1
Wayve 2023 · 论文
一句话总结 — GAIA-1(“面向自主性的生成式人工智能”)是一个生成式世界模型,接收视频、文本和自车动作作为输入,生成对自车行为具有精细控制能力的逼真未来驾驶场景,并从原始驾驶数据中学习道路行为的隐含规则。
问题
构建能够安全应对真实世界场景的非结构化复杂性的自动驾驶系统仍然困难,其中一个关键子问题是预测:随着世界的演变,预判车辆动作可能引发的各种潜在结果。此前的世界模型依赖标注数据或低维仿真表示,无法生成复杂真实场景的逼真样本,而视频生成模型能产出逼真的像素,却对演化中的世界动态表示得很弱。GAIA-1 力图兼取两者之长:生成式视频模型的可扩展性与真实感,以及世界模型对未来的有意义表示。
方法与架构
GAIA-1 有三个可训练组件:一个图像分词器、一个自回归世界模型和一个视频扩散解码器。
- 图像分词器(0.3B):一个全卷积二维 U-Net 离散自编码器,将每一帧 图像下采样 倍,得到 个词元,词表大小 (约 的比特压缩率)。该模型使用图像重建损失(、、感知损失、GAN 损失)、量化损失,以及一个归纳偏置损失——对预训练 DINO 特征进行余弦相似度蒸馏,使词元更具语义性而非高频细节。
- 统一词元序列:在每个时间步,词元按文本—图像—动作交错排列:文本通过冻结的 T5-large 编码( 个词元),动作作为 个标量(速度、曲率)线性嵌入,全部处于共享的 空间,并配有分解的时空位置编码。视频下采样至 6.25 Hz; 帧(4 秒)给出总序列长度 。
- 世界模型(6.5B):一个带因果掩码的自回归 Transformer,训练目标为在给定所有过去词元的条件下预测下一个图像词元:
其中 是图像词元, 是文本词元, 是动作词元。条件丢弃(无条件/动作条件/文本条件分别以 20%/40%/40% 的比例)使单个模型同时具备无条件生成、动作条件生成和文本条件生成的能力。
- 视频解码器(2.6B):一个具有分解式空间/时间注意力的三维 U-Net 视频扩散模型,以多任务方式训练(图像生成、视频生成、正向/反向自回归解码、插帧),采用 参数化的去噪目标:
其中 是加噪视频, 是条件图像词元, 是任务特定掩码。它将词元渲染为像素,并将时间分辨率由 6.25 Hz 逐步上采样到 12.5 Hz、再到 25 Hz(DDIM,50 步),出于稳定性考虑从最后几帧开始反向解码。
- 推理:argmax 采样容易陷入重复循环,而完整采样又会触及不可靠的分布尾部,因此采用 top-k 采样;长序列推演使用滑动窗口。文本一致性通过无分类器引导实现,,引导强度在词元和帧维度上按计划调整,并通过替换为无条件 logits 实现负向提示。
实验结果
在 4,700 小时的私有伦敦城市驾驶数据(2019–2023 年,25 Hz,约 4.2 亿张图像)上训练,并采用特征平衡采样;验证集为 400 小时的严格地理围栏留出数据。世界模型在 64 块 A100 80GB GPU 上训练 100k 步,耗时 15 天;解码器在 32 块 A100 上训练 300k 步。GAIA-1 遵循类似 LLM 的缩放定律:对参数量从 0.65M 到 650M 的模型拟合幂律 (每词元计算量 ),能够以不到 的计算量准确预测最终 6.5B 模型的验证集交叉熵,外推结果表明更多数据和计算量仍有大量提升空间。所展示的能力均为定性结果(未报告标准基准数值):稳定的数分钟长的完全想象驾驶;从单个视频提示生成多个合理的未来(让行交互、环岛选择、变化的交通状况);通过文本控制天气和光照;以及超出分布的动作控制外推——强制自车驶出车道,这在专家数据中从未出现,却能生成几何上准确的场景以及做出反应的智能体(对向车辆会做出规避动作以避免碰撞)。
对SLAM的意义
GAIA-1 确立了自动驾驶中“世界模型作为仿真器”的范式:动态特性不再是手工编写的物理规则和行为规则(CARLA 式仿真器),而是从原始数据中学习并通过生成式方式查询,从而产生多样化的合成训练场景。其对三维几何的涌现式理解(过减速带时的俯仰/横滚、一致的道路布局)纯粹来自下一词元预测。它直接启发了后续的世界基础模型,例如 NVIDIA Cosmos。对 SLAM 研究者而言,它提出了 Spatial AI 的核心问题:显式度量地图应如何与隐式学习到的动态模型相连接——例如,用 SLAM 进行定位,同时让世界模型为规划想象短时程的未来。