WorldVLA

Cen (Alibaba) 2025 · 论文

一句话总结 — WorldVLA 用一个自回归 transformer 将视觉-语言-动作模型与世界模型统一起来,该模型同时预测机器人动作 token 和未来图像 token,使学习环境物理与生成动作相互强化。

问题

机器人学习流程已经分裂成两个互不关照对方长处的阵营。视觉-语言-动作模型(RT-2、OpenVLA)把观测和指令映射为动作,但只把动作当作输出——从未把它当作需要被理解的输入——因此它们没有机制去预测这些动作的后果。世界模型(GAIA-1、Cosmos)根据观测和动作预测视觉世界将如何演化,但它们自身并不产生任何动作。WorldVLA 提出的问题是:能否用一个自回归模型同时完成这两件事——在单一框架中统一动作与图像的理解生成。

方法与架构

WorldVLA 在图像观测 oo、动作 aa 和语言指令 ll 上定义了一个动作(策略)模型 πθ\pi_\theta 和一个世界模型 fϕf_\phi

at=πθ(atoth:t,l),ot=fϕ(ototh:t1,ath:t1)a_t = \pi_\theta(a_t \mid o_{t-h:t},\, l), \qquad o_t = f_\phi(o_t \mid o_{t-h:t-1},\, a_{t-h:t-1})

并将两者统一进一个模型 MψM_\psi 中,该模型有一个策略头和一个世界头,共享全部权重。

L=Laction+αLworld\mathcal{L} = \mathcal{L}_{action} + \alpha\, \mathcal{L}_{world}

其中 α=0.04\alpha = 0.04 用来平衡数量很少的动作 token(7 个)与数量很多的图像 token(256/1024 个)。

实验结果

在 LIBERO 基准(每个任务 50 次滚动展开的成功率)上,512×512 分辨率的 WorldVLA 在 Spatial / Object / Goal / Long 四个子集上分别取得 87.6 / 96.2 / 83.4 / 60.0,平均 81.8,超过了离散动作的 OpenVLA 基线(平均 76.5),且未经大规模机器人预训练;256×256 版本的平均成绩为 79.1。消融实验揭示了这种相互增强的效果:加入世界模型数据后,纯动作模型的平均成功率从 62.8 提升到 67.2;朴素的自回归动作分块会使其骤降到 54.0,而所提出的注意力掩码则将其恢复到 76.6(配合世界模型数据后为 78.1,即完整模型的成绩)。概括来说:抓取任务的成功率比同骨干网络的动作模型高出约 4%,朴素分块会造成 10%–50% 的成功率下降,而所提掩码带来 4%–23% 的提升。反过来,动作数据也改善了世界建模:在 50 帧的滚动展开中,与纯世界模型相比,FVD 从 718.6 降到 674.1(约提升 10%),PSNR 从 23.98 升到 24.30,而纯世界模型在物理规律上明显失败(物体消失、抽屉打不开)。仅用世界模型任务对动作模型做预训练同样有帮助(62.8 提升到 66.8)。

对SLAM的意义

WorldVLA 标志着本层级两大线索——世界模型(GAIA-1、Cosmos)与 VLA(RT-2、OpenVLA)——汇聚成单一架构,弥合了”预测世界”与”在世界中行动”之间的一致性缺口。它的消融实验量化了 SLAM 研究者直觉上早已知道的一件事:必须预测运动的几何后果的模型,会学到更适合选择运动的表示,反之亦然。对 SLAM 而言,它勾勒出 Spatial AI 技术栈一个可能的终局状态:学习式动态与动作生成融合于一个模型之中,而显式的 SLAM 几何仍然作为互补的度量接地来源,用以约束和验证该模型所想象的滚动展开结果。

相关条目