RT-2

Brohan (DeepMind) 2023 · 论文

一句话总结 — RT-2 将机器人动作表示为文本词元,并在网络规模的视觉语言数据和机器人轨迹数据上联合微调一个大型视觉语言模型,将互联网知识迁移到机器人控制中,并创造了“视觉-语言-动作”(VLA)模型这一术语。

问题

传统的机器人学习数据饥渴且脆弱:最强大的语言和视觉语言模型是在数十亿网络词元和图像上训练的——在可预见的未来,机器人数据的规模不可能与之匹敌。此前将 LLM/VLM 引入机器人领域的尝试大多将它们用作高层规划器,把指令解析为由独立的低层控制器执行的基本动作,这样就永远无法从网络知识中受益。RT-2 探究的问题是:能否将大型预训练视觉语言模型直接集成到低层机器人控制中,以提升泛化能力并激发涌现式的语义推理。

方法与架构

“terminateΔposxΔposyΔposzΔrotxΔrotyΔrotzgripper-extension”\text{“terminate} \enspace \Delta\text{pos}_{x} \enspace \Delta\text{pos}_{y} \enspace \Delta\text{pos}_{z} \enspace \Delta\text{rot}_{x} \enspace \Delta\text{rot}_{y} \enspace \Delta\text{rot}_{z} \enspace \text{gripper-extension”}

例如 "1 128 91 241 5 101 127"。对于 PaLI-X,1000 以内的整数已经有各自唯一的词元;对于 PaLM-E,256 个使用频率最低的词元被覆写为动作词元(一种符号调优形式)。机器人数据被转换为 VQA 格式:“Q: 机器人应采取什么动作来[指令]?A:”,后接动作字符串。

实验结果

在一台 7 自由度移动式操作机器人上进行了约 6,000 次真实机器人试验评测:

对SLAM的意义

RT-2 确立了 OpenVLA、NaVILA、WorldVLA 以及大多数后续机器人基础模型所采用的“动作即词元”VLA 范式,并证明了网络规模的预训练确实能够迁移到具身控制中。对 SLAM 研究者而言,它提出了 Spatial AI 时代的一个关键开放问题:如果网络知识能让策略泛化到新物体,那么 SLAM 式的空间知识(度量地图、持久几何)是否也能以同样的方式注入,从而泛化到新环境和长时程导航?

相关条目