LEGS
Yu 2024 · 论文
一句话总结 —— 语言嵌入高斯散射(Language-Embedded Gaussian Splats):一台移动机器人在行驶过程中在线增量式构建房间尺度的3DGS地图,并配备尺度条件化的CLIP特征场,在开放词汇查询成功率上与LERF相当,而训练速度快3.5倍。
问题
语义3D地图对”在办公室、仓库、商店和家庭中搜索感兴趣的物体”很有价值,但LERF——语言嵌入3D的参考方法——需要离线地对每个场景进行NeRF优化,并且所有姿态需提前已知(LangSplat同样如此,它还必须先对所有图像训练一个场景特定的自编码器)。而机器人需要相反的工作流程:在穿越一个此前未见过的环境时(本文中不小于750平方英尺)同时构建语义地图,这些轨迹本身受限——相机几乎与货架和墙壁平行运动,姿态漂移会不断累积——并要立即回答查询。基于点云的方法(ConceptFusion、CLIP-Fields)在每个点上融合单一特征,从而失去了LERF尺度条件化场所提供的多尺度物体-部件推理能力。
方法与架构
一台Fetch机器人,配备一个前向的RGB-D Realsense D455以及两个侧向的ZED 2立体相机(外参已知);处理流程传输到一台配有两块RTX 4090的桌面机(一块用于LEGS训练,约15 GB;一块用于DROID-SLAM,最多18 GB):
- 多相机重建:离线SfM无法配准几乎不重叠的侧向相机,因此DROID-SLAM在线跟踪一路侧向ZED视频流,而支架的CAD外参用于外推另外两个相机的姿态——从而免费获得三倍的有效视野。跟踪以30 fps运行。
- 增量式3DGS构建:对Nerfstudio的Splatfacto进行修改,使其能够接收图像-姿态对的流。新的高斯按关键帧初始化,方法是对深度图像采样500个像素,并用一个学习到的立体模型给出的度量深度对其反投影(该模型在细长和透明物体上表现准确)。
- 循环中的全局光束法平差:每150个关键帧,DROID-SLAM的全局BA会在关键帧图上重新优化所有历史姿态(最小化重投影点与修订后光流对应关系之间的马氏距离),并相应更新3DGS训练相机——从而缓解本会产生重复物体、模糊几何和鬼影的漂移问题。(在splat内部进行姿态跟踪,如SplaTAM那样,每帧最多耗时一秒——在这里太慢了。)
- 语言嵌入(显式-隐式混合):几何部分是显式高斯;语义则存在于一个尺度条件化的场 中——位置 经过一个多分辨率哈希编码得到 ,再由一个MLP 输出 维语言特征。特征通过基于分块的光栅化器渲染为特征图,并以训练图像的多尺度CLIP裁剪图作为监督信号(与LERF一致,而不同于FMGS对各尺度的CLIP做平均)。推理在1080p下大约以50 Hz运行。
- 查询:一段文本提示经CLIP编码,计算出LERF风格的相关度图(relevancy map),查询结果在世界坐标系中被定位为3D高斯均值上相关度的argmax——无需对稠密点云做体渲染。
实验结果
- 物体检索(recall)(4个场景;每场景15个GPT-4V生成的开放词汇查询;成功定义为argmax点投影落在新视角中人工标注的框内):LEGS对比LERF——Office Kitchen 10/15对9/15,Office Dining Area 11/15对11/15,Office Workspace 9/15对10/15,Grocery Store Testbed 10/15对12/15——成功率相当,在开放词汇和长尾查询上”准确率最高达66%”。
- 训练时间(达到平均PSNR为20):LEGS为12分钟,LERF为44分钟——快3.5倍以上,而且LEGS是增量式获得姿态的,LERF则用的是最终姿态。
- 光束法平差消融实验(训练视角PSNR,无BA→有BA):D435 18.6 → 22.7,D455 20.0 → 23.5,ZED 2 19.2 → 23.8——BA在所有相机上都消除了鬼影重复(例如一个重复的排球)。
- 多相机对比单相机:三相机装置能重建单个ZED所遗漏的低视角物体(垃圾滑道、湿滑地面警示牌)。
- 论文指出的失败模式:训练视角中的小型/远处物体、物体与背景颜色相似、语义相似物体上的误检,以及静态场景假设。
对SLAM的意义
LEGS是从”SLAM即几何”迈向Spatial AI的一个具体步骤:机器人为一家商店或仓库建图后,可立即被问及”急救箱在哪里?”。它是最早将在线3DGS训练与语言对齐特征监督相结合的系统之一,表明LERF的思路能够从”先采集再离线优化”迁移到增量式机器人建图——由经典SLAM机制(DROID-SLAM跟踪+周期性全局BA)提供姿态一致性,使在线splat训练在房间尺度上得以成功运行。