ZoeDepth
Bhat 2023 · 论文
一句话总结 — 将相对深度预训练(MiDaS/DPT风格)与一个轻量级的度量分箱模块(Metric Bins Module)相结合,实现零样本的度量深度估计,为单目SLAM提供具有绝对尺度的深度先验。
问题
单目深度研究已分裂为两个流派:相对深度模型(MiDaS、DPT)能够跨领域泛化,但其输出深度只能确定到一个未知的尺度和偏移;而度量深度模型能预测绝对距离,但会对训练所用的单一相机/数据集产生过拟合。SLAM需要同时具备这两种特性——处处都是以米为单位的深度。在深度尺度差异很大的多个数据集上(室内约10米,室外约80米)训练一个单一的度量模型,通常会导致性能下降甚至彻底不收敛。
方法与架构
两阶段训练。 第一阶段在12个数据集组成的M12混合数据集上,使用尺度-偏移不变的多任务损失,预训练一个MiDaS风格的编码器-解码器(采用BEiT384-L Transformer编码器的DPT架构)用于相对深度估计。第二阶段在解码器上附加一个或多个轻量级度量头(每个头的参数量不到骨干网络的1%),并在度量数据集(NYU Depth v2和/或KITTI)上进行端到端微调。
度量分箱模块。 该头接入瓶颈层以及四个解码器层级(分辨率分别为1/32、1/16、1/8、1/4、1/2)。沿用自适应分箱的思路,像素处的深度是逐像素分箱中心的概率加权组合:
与LocalBins(从少量种子分箱开始,在每个解码器层进行分裂)不同,ZoeDepth在瓶颈层就预测出全部个分箱中心,并在每个解码器层通过吸引子层对其进行调整:一个MLP为每个像素预测个吸引点,每个分箱中心通过逆吸引子移动:
其中设定吸引强度,各解码器层的。吸引即是收缩(在不受分裂所施加的宽度总和约束下进行精细化)。
对数二项概率。 由于分箱是有序的,分箱上的概率并非简单的softmax,而是一个具有预测模式和温度的二项分布:
该分布在对数空间中通过Stirling近似计算,并用归一化,从而保持单峰性。像素级监督使用尺度不变的对数损失。
领域头+路由器。 独立的度量头在共享骨干网络之上充当室内/室外专家;一个作用于瓶颈特征的路由器MLP为每张图像挑选对应的头。三种变体——标签指定式、训练式和自动路由式——使得在推理时无需任何场景类型标签即可部署。
实验结果
在NYU Depth v2基准上:ZoeD-X-N(不使用相对深度预训练)达到REL 0.082,相比此前最先进的NeWCRFs(REL 0.095)提升13.7%——单独验证了度量分箱设计的有效性。ZoeD-M12-N(M12预训练加NYU微调)达到REL 0.075,相比NeWCRFs总计提升21%。在NYU+KITTI上联合训练时,旗舰的双头ZoeD-M12-NK在NYU上保持REL 0.077(仅比仅用NYU的模型差2.6%),而NeWCRFs性能下降约15%(从0.095降至0.109),AdaBins/PixelBins在联合训练设置下则无法收敛;单头变体仅下降8%(0.081)。在向8个未见过数据集的零样本迁移测试中,ZoeD-M12-NK相比NeWCRFs在平均相对指标(mRI,综合、REL、RMSE)上,室内场景提升5.3%(HyperSim)到46.3%(DIODE Indoor),室外场景提升7.8%(Virtual KITTI 2)到高达976.4%(约11倍,DIML Outdoor),仅在DDAD上出现下降(−12.8%)。代码和预训练模型均已公开。
对SLAM的意义
单目SLAM存在尺度歧义;像MiDaS这样的相对深度网络无法解决这一问题,因为其输出仅能确定到一个仿射变换。ZoeDepth是第一个能够跨领域实现零样本度量深度的实用模型,因此单一网络就能为单目SLAM的初始化、稠密化或尺度漂移校正提供尺度信息。其”先相对、后度量”的训练范式已被Metric3D和Depth Anything等后续方法所采用,使ZoeDepth成为相对深度基础模型与度量尺度机器人应用之间的一个关键连接点。
相关条目
- MiDaS — 多数据集相对深度骨干网络及其训练方案。
- DPT — ZoeDepth所构建于其上的基于ViT的稠密预测架构。
- Metric3D — 实现零样本度量深度的另一条路径,基于标准相机模型。
- Depth Anything — 对深度基础模型进行规模化扩展;在其度量微调中使用了ZoeDepth框架。
- Depth from sensor — 度量深度网络意图替代或补充的对象。
- Scale ambiguity — 度量深度先验所解决的单目SLAM问题。