NaVILA

Cheng 2024 · 论文

一句话总结 — NaVILA 将视觉-语言-动作范式从桌面操作任务扩展到腿式机器人导航,将一个以自然语言输出中层动作的视觉语言模型与一个负责执行这些动作的强化学习运动策略配对,使机器人能够依据语言指令穿行于真实三维环境。

问题

用腿式机器人进行视觉与语言导航(VLN)具有双重吸引力:语言是人类指挥机器人的一种灵活方式,而腿部结构能让机器人穿越轮式底盘难以应对的复杂杂乱场景。但将一条人类指令一路转化为关节级控制十分困难——操作类 VLA 将底层指令量化为词元,然而 LLM/VLM 是基于自然语言训练的,强行让其输出精确的非语言动作会挤占其预训练所依赖的推理能力本身。NaVILA 探究的问题是:语言本身是否是更好的动作表示。

方法与架构

实验结果

对SLAM的意义

NaVILA 是基础模型对基于经典 SLAM 的导航技术栈发起挑战的一个具体例证:它用一个以指令为条件的策略取代了显式的“建图—再规划”流程,该策略的“地图”只是一个记忆帧库。同时,它的设计也显示出几何信息仍然大有用处之处——MASt3R 位姿估计为其人类视频训练数据打标签,LiDAR 高度图保障机器人安全,度量定位与持久地图与 VLA 的语义指令跟随是互补的;为 VLA 提供由 SLAM 支撑的空间记忆的混合系统是一个活跃的研究方向。

相关条目