TANDEM

Koestler 2021 · 论文

一句话总结 — 一种实时单目稠密SLAM,将DSO风格的光度光束法平差与一个学习型多视图立体网络(CVA-MVSNet)以及TSDF融合结合起来,并将新帧与从全局模型渲染出的深度进行配准跟踪。

问题

从单目相机进行实时稠密重建,比RGB-D建图(深度可以直接读出并融合)要困难得多。经典的直接法(DSO)跟踪精度高,但只能重建稀疏/半稠密的点云;精确的多视图立体传统上是离线运行的,而完全学习式的稠密SLAM在跟踪精度上落后于经典方法。TANDEM探讨的问题是:如何从单个移动相机同时获得实时跟踪全局一致的稠密建图——这是第一个将基于学习的MVS集成到传统的基于优化的VO中的系统。

方法与架构

三个组件在一个紧密循环中运行(VO运行在CPU线程上;MVS推理与TSDF融合在GPU上异步运行):

1. 具有稠密前端的视觉里程计。 后端是DSO的直接稀疏窗口化光度光束法平差。前端通过将每个新帧与上一个关键帧进行稠密直接图像对齐来进行跟踪,使用一个组合深度缓冲区:在可用的情况下使用活动窗口中各点的稀疏深度DnDSOD_{n}^{\text{DSO}},否则使用从增量构建的全局TSDF模型渲染出的稠密深度DnTSDFD_{n}^{\text{TSDF}}——这是第一个针对全局模型进行跟踪的单目稠密前端,也是相较于纯稀疏跟踪的关键鲁棒性提升点。

2. CVA-MVSNet。 给定活动关键帧{(Ii,Ti)}i=1n\{(I_{i},\mathbf{T}_{i})\}_{i=1}^{n},共享权重的2D U-Net提取多尺度特征Fis\mathbf{F}_{i}^{s};参考关键帧的深度在3个分辨率递增的级联阶段中被预测出来。每个阶段将特征扭曲到逐像素的深度假设Dhyps\mathbf{D}_{hyp}^{s}上,形成特征体Vis\mathbf{V}_{i}^{s}。由于滑动窗口中的关键帧基线极不均匀(存在严重遮挡/不重叠),对各视图等权重加权的标准方差代价度量被替换为自适应视图聚合:

Cs=i=1,ijn(1+Wis)(VisVjs)2n1\mathbf{C}^{s}=\frac{\sum_{i=1,i\neq j}^{n}(1+\mathbf{W}_{i}^{s})\,\odot\,(\mathbf{V}_{i}^{s}-\mathbf{V}_{j}^{s})^{2}}{n-1}

其中Wis\mathbf{W}_{i}^{s}是由一个浅层3D CNN根据(VisVjs)2(\mathbf{V}_{i}^{s}-\mathbf{V}_{j}^{s})^{2}预测出的逐体素权重,使网络能够降低错误视图的权重。代价体经过一个3D U-Net正则化,并通过softmax得到概率体Ps\mathbf{P}^{s};深度即为其期望:

Ds[h,w]=d=1Ds  Ps[d,h,w]Dhyps[d,h,w]D^{s}[h,w]=\sum_{d=1}^{D^{s}}\;\mathbf{P}^{s}[d,h,w]\cdot\mathbf{D}_{hyp}^{s}[d,h,w]

后续阶段在上采样后的前一阶段深度周围采样较少的假设(D1=48D^{1}=48个平面覆盖全范围,之后逐渐减少),使用在全部三个阶段上求和的L1L_1损失进行训练。

3. TSDF融合。 预测出的深度图被融合进一个体素哈希化的截断有符号距离函数网格中,由此得到既用于可视化网格、也供稠密跟踪前端读取的一致全局模型。

实验结果

对SLAM的意义

TANDEM清晰地展示了”经典+学习”混合设计模式:对位姿保留易于理解的几何估计器,恰好在经典方法薄弱的地方(无纹理区域的稠密深度)插入学习模块,并让稠密地图反馈回跟踪环节。它证明了单目相机无需深度传感器即可在线产生稠密的TSDF地图,是DROID-SLAM等完全学习式管线以及iMAP/NICE-SLAM等神经隐式系统之外一种务实的替代方案。

相关条目