NaVILA
Cheng 2024 · 论文
一句话总结 — NaVILA 将视觉-语言-动作范式从桌面操作任务扩展到腿式机器人导航,将一个以自然语言输出中层动作的视觉语言模型与一个负责执行这些动作的强化学习运动策略配对,使机器人能够依据语言指令穿行于真实三维环境。
问题
用腿式机器人进行视觉与语言导航(VLN)具有双重吸引力:语言是人类指挥机器人的一种灵活方式,而腿部结构能让机器人穿越轮式底盘难以应对的复杂杂乱场景。但将一条人类指令一路转化为关节级控制十分困难——操作类 VLA 将底层指令量化为词元,然而 LLM/VLM 是基于自然语言训练的,强行让其输出精确的非语言动作会挤占其预训练所依赖的推理能力本身。NaVILA 探究的问题是:语言本身是否是更好的动作表示。
方法与架构
- 两层框架:一个基于 VILA 的 VLM 负责语义指令跟随,并输出以语言表达的中层动作——例如“向右转 30 度”“向前移动 75 厘米”——而一个独立的低层视觉运动策略实时将其转换为关节运动。VLA 以低频率运行;运动策略则以实时频率运行,负责避障和平衡。
- VLM(高层):VILA 的视觉编码器 → MLP 投影器 → LLM,在 SFT 阶段全部不冻结。一个导航提示通过文本提示(而非新增特殊词元)区分最新帧(“当前观测”)和均匀采样的更早帧(作为记忆库的“历史观测视频”);使用 8-64 帧。一个正则表达式解析器从 LLM 输出中提取动作类型及其参数(距离/角度)——实测每一个输出的动作均被成功解析。
- SFT 数据混合:(1)通过最短路径跟随器从 R2R-CE 和 RxR-CE 生成的仿真导航数据,合并连续动作(最多三步,例如两个 25 厘米步长合并为一个 50 厘米步长)并对停止动作进行再平衡;(2)真实人类漫游视频——2K 段第一人称 YouTube 视频,采样为 2 万条轨迹,动作由 MASt3R 度量相机位姿估计恢复,指令由 VLM 生成描述再经 LLM 改写生成(这是首个在连续场景中直接基于人类视频训练导航的工作);(3)辅助任务——EnvDrop 增强指令、轨迹摘要、ScanQA 三维问答;(4)通用 VQA,用以保留世界知识。
- 运动策略(低层):离散指令被转换为速度指令 ,执行时长与 VLA 所述的距离/角度相匹配。一个单阶段的 PPO 策略(不使用教师-学生蒸馏)为 Unitree Go2 的腿部电机输出期望关节位置 。评判器(critic)能看到具有特权信息的地形高度扫描;执行器(actor)仅能看到真实世界中可获得的本体感觉历史,以及一张由 LiDAR 点云构建的 2.5D 高度图(Unitree L1,360°×90° 视场角,对最近 5 次扫描取最大值滤波)——LiDAR 能处理深度/RGB 会失效的玻璃和强光场景。在 Isaac Lab 中使用光线投射,在一块 RTX 4090 上实现超过 6 万 FPS 的训练吞吐量。
- VLN-CE-Isaac 基准:一个新的 Isaac Sim 基准,包含 1,077 条可通行的 R2R Val-Unseen 轨迹,评估的是全物理、关节级的执行,而非 Habitat 式的传送式智能体。
实验结果
- VLN-CE 基准(Val-Unseen):在 R2R-CE 上,NaVILA 仅使用单视角 RGB 达到 SR 54.0 / SPL 49.0 / NE 5.22——比此前单视角 SoTA NaVid(SR 37.0)提升约 17% 的 SR,并与使用全景图、深度、里程计或仿真器预训练路点预测器的方法相当甚至更优;在 RxR-CE 上得分为 SR 49.3 / SPL 44.0 / nDTW 58.8。
- 跨数据集零样本(仅在 R2R 上训练,在 RxR Val-Unseen 上测试):SR 达 34.3,高于 NaVid 的 23.8。
- 场景理解:在 ScanQA 验证集上,NaVILA(64 帧)达到 CIDEr 102.7,高于此前 VLA SoTA NaviLLM 的 75.9,甚至超过需要扫描数据或带位姿 RGB-D 的三维大模型。
- 运动控制:相比基于蒸馏的 ROA,线速度/角速度误差从 0.161/0.152 降至 0.066/0.113,碰撞率从 3.09 降至 0.81。
- VLN-CE-Isaac:基于视觉的策略在 Go2 上比盲策略(仅本体感觉)高出 14% 的 SR(50.2 对 36.2),在 H1 人形机器人上高出 21%(45.3 对 24.4),接近 oracle 执行的上限(51.3)。
- 真实世界:在工作场所、家庭和室外场景中进行 25 条指令 × 3 次试验,NaVILA 达到 88% 的成功率(复杂多房间指令为 75%),优于 GPT-4o 基线;同一个 VLA 无需重新训练即可驱动一台相机高度和视角均不同的 Booster T1 人形机器人。
对SLAM的意义
NaVILA 是基础模型对基于经典 SLAM 的导航技术栈发起挑战的一个具体例证:它用一个以指令为条件的策略取代了显式的“建图—再规划”流程,该策略的“地图”只是一个记忆帧库。同时,它的设计也显示出几何信息仍然大有用处之处——MASt3R 位姿估计为其人类视频训练数据打标签,LiDAR 高度图保障机器人安全,度量定位与持久地图与 VLA 的语义指令跟随是互补的;为 VLA 提供由 SLAM 支撑的空间记忆的混合系统是一个活跃的研究方向。