掩码深度建模(LingBot-Depth)

Tan 2026 · 论文

一句话总结 — 将RGB-D传感器在玻璃、镜面和光亮金属上留下的空洞视为掩码自编码器式预训练的天然掩码:一个ViT学习RGB与深度的联合嵌入,从受损的传感器输入中重建完整的度量深度,在精度和覆盖率上超越顶级RGB-D相机。

问题

RGB-D相机是唯一能同时提供度量尺度、像素对齐的密集几何信息和实时采集能力的传感模态——但其立体/结构光匹配在外观歧义下会失效:低纹理表面、镜面反射、透明材质、复杂光照。结果是数据严重受损和缺失值,恰恰出现在室内机器人最需要几何信息的地方。该论文并未将这些失效视为需要丢弃的噪声,而是重新构建了问题:缺失区域是内在反映几何歧义的”被掩码”信号,因此深度补全成为一个掩码建模问题,以完整的RGB图像作为救援上下文。

方法与架构

**掩码深度建模(MDM)**遵循MAE的编码器-解码器范式,但预测深度而非外观:

实验结果

对SLAM的意义

RGB-D SLAM系统(KinectFusion式融合、RGB-D里程计)隐式地信任传感器;玻璃墙和镜子是其最常见的真实世界失效案例之一,尤其是在这类表面随处可见的室内环境中。LingBot-Depth可作为一个可直接替换的学习型传感器前端——论文自己的相机跟踪实验表明,原始传感器深度在玻璃场景中会导致严重漂移,而补全后的深度能保持干净的跟踪——从而在不改变SLAM算法本身的情况下扩展RGB-D SLAM的可用范围。其天然掩码预训练思想还为SLAM提供了一种跨模态对齐的RGB-深度联合表征。

相关条目