掩码深度建模(LingBot-Depth)
Tan 2026 · 论文
一句话总结 — 将RGB-D传感器在玻璃、镜面和光亮金属上留下的空洞视为掩码自编码器式预训练的天然掩码:一个ViT学习RGB与深度的联合嵌入,从受损的传感器输入中重建完整的度量深度,在精度和覆盖率上超越顶级RGB-D相机。
问题
RGB-D相机是唯一能同时提供度量尺度、像素对齐的密集几何信息和实时采集能力的传感模态——但其立体/结构光匹配在外观歧义下会失效:低纹理表面、镜面反射、透明材质、复杂光照。结果是数据严重受损和缺失值,恰恰出现在室内机器人最需要几何信息的地方。该论文并未将这些失效视为需要丢弃的噪声,而是重新构建了问题:缺失区域是内在反映几何歧义的”被掩码”信号,因此深度补全成为一个掩码建模问题,以完整的RGB图像作为救援上下文。
方法与架构
**掩码深度建模(MDM)**遵循MAE的编码器-解码器范式,但预测深度而非外观:
- 分离的patch嵌入。 RGB(3通道)和深度(1通道)拥有各自独立的patch嵌入层,patch大小为14(遵循DINOv2),每种模态生成个空间对齐的token网格。每个token接收一个共享的可学习二维空间位置编码,加上一个模态编码(RGB为1,深度为2)。
- 天然掩码。 完全缺失的深度patch总是被掩码;混合了有效/无效值的patch以0.75的概率被掩码;随机的完全有效patch被补充进掩码集合,使整体深度掩码率达到60–90%。由于这些天然掩码源自真实的歧义(而非随机丢弃),重建被有意设计得更难——而未被掩码的RGB图像始终作为条件提供。同一框架仅通过掩码策略就统一了两个任务:掩码所有深度token→纯单目深度估计;仅掩码无效token→深度补全。
- 编码器/解码器。 所有RGB token+未掩码的深度token+一个[cls] token输入一个24层的ViT-Large(ViT-L/14,DINOv2初始化)。随后丢弃潜在深度token;[cls] token被广播加到上下文token上,驱动一个ConvStack解码器(改编自MoGe):一个由残差块和转置卷积(卷积核2,步幅2)组成的金字塔,将分辨率从上采样到,每个尺度都注入UV位置编码。监督采用对有效真值像素的简单L1损失。注意力可视化证实深度查询会关注空间上对应的RGB区域。
- 训练。 25万次迭代,128块GPU上全局批量1024(约7.5天,BF16),AdamW(,,权重衰减0.05),编码器学习率/解码器学习率,带预热和阶梯衰减;数据增强包括色彩抖动、JPEG压缩伪影、运动模糊、散粒噪声。
- 数据整理。 一个合成Blender流水线从442个室内场景渲染RGB+完美深度+散斑图案立体像对(基线从0.05–0.2米采样,焦距16–28毫米),然后运行SGM立体匹配以生成带有真实失效空洞的类传感器深度。一个3D打印的模块化装置搭载商用相机(RealSense、Orbbec Gemini、ZED),采集200万张真实图像,并用FoundationStereo衍生的伪深度标签(经左右一致性检查)。加上七个公开RGB-D数据集,语料库总计约1000万个样本;300万个RGB-深度对(200万真实+100万模拟)、代码和权重均已公开发布。
实验结果
- 深度补全,协议1(分块掩码+Kinect式噪声,四个难度级别):在iBims、NYUv2和DIODE上每个难度级别的RMSE/REL均为最佳——例如NYUv2极端难度RMSE为0.181,而PromptDA为0.324;iBims极端难度为0.345,而0.607;即使在极端设置下,室内基准上相比最佳竞争对手的RMSE降幅也超过40%。
- 协议2(以稀疏SfM点作为输入,ETH3D):室内RMSE为0.192(比最佳基线PriorDA的0.360低47%),室外为0.664(比OMNI-DC的1.069低38%),室内为0.982。
- 作为预训练骨干网络:以LingBot-Depth初始化的MoGe在10个单目深度基准上均超过DINOv2初始化(例如NYUv2仿射不变REL为0.044,而后者为0.056);作为FoundationStereo的单目先验,它收敛更快(第5轮HAMMER EPE为0.27,而原版为0.46),并在所有场景中达到最佳或相当水平(第15轮Middlebury EPE为0.75,HAMMER为0.17)。
- 应用,零后训练:在Orbbec和ZED传感器均失效的场景(玻璃大厅、健身房镜子、水族馆隧道)中,以30 FPS、640×480分辨率实现时间一致的视频深度补全;在玻璃密集场景中,使用细化后的深度使SpatialTrackerV2的相机轨迹更平滑;灵巧抓取成功率(20次试验中):钢杯17 vs 13(原始深度)、透明杯16 vs 12、玩具车16 vs 9、透明储物盒10 vs 使用原始深度时完全无法抓取。
对SLAM的意义
RGB-D SLAM系统(KinectFusion式融合、RGB-D里程计)隐式地信任传感器;玻璃墙和镜子是其最常见的真实世界失效案例之一,尤其是在这类表面随处可见的室内环境中。LingBot-Depth可作为一个可直接替换的学习型传感器前端——论文自己的相机跟踪实验表明,原始传感器深度在玻璃场景中会导致严重漂移,而补全后的深度能保持干净的跟踪——从而在不改变SLAM算法本身的情况下扩展RGB-D SLAM的可用范围。其天然掩码预训练思想还为SLAM提供了一种跨模态对齐的RGB-深度联合表征。
相关条目
- Depth from sensor — 深度传感器的工作原理及其失效场景
- Depth Anything V2 — 单目深度基础模型,在反射表面上同样表现出色
- Marigold — 具有精细细节的生成式深度估计
- KinectFusion — 使用修正后深度的经典流水线