Neural Ray Surfaces
Vasiljevic 2020 · 论文
一句话总结 — 在自监督深度与自我运动学习中,用一个学习得到的逐像素光线曲面取代固定的针孔投影模型,使同一套光度训练框架无需标定即可适用于鱼眼、折反射甚至水下相机。
问题
自监督学习已成为深度和自我运动估计的强大工具,但这一系列方法都共享一个显著的隐藏局限:视图合成步骤假定一个已知的参数化相机模型——几乎总是标准的针孔几何模型。因此该方法在明显偏离这一假设的成像系统上会彻底失效(折反射相机、水下成像、装在弯曲挡风玻璃后面的相机)。参数化畸变模型只是近似正确的,每种相机类型都需要一个新的可微投影模型,而对某些场景来说这类模型根本不存在。即便是学习针孔内参(Gordon 2019)也无法覆盖这些情形。
方法与架构
标准的自监督框架(Zhou 等人)被保留下来:一个深度网络 ,一个位姿网络 用于预测目标帧与上下文帧之间的 ,以及光度变形
使用 (SSIM+L1 外观损失,对上下文帧取逐像素最小值并加自动掩码,再加边缘感知平滑项)进行训练。发生变化的是反投影 和投影 。遵循 Grossberg 与 Nayar 的通用相机模型,每个像素都被赋予一条单位观察光线:一个与深度网络编码器共享的第二解码器预测光线曲面 。
反投影是闭式的——将光线按深度从相机中心 (对于中心相机设为原点)进行缩放:
投影没有闭式解:一个三维点 必须与上下文图像中光线方向与 最吻合的像素相匹配,
这一操作的复杂度为 ,且不可微。三项改进使其可训练:(1)softmax 关联——用带温度参数 的 softmax 取代对相似度张量 的 argmax,将 逐步退火至趋近独热编码,再读出像素索引并用空间变换网络进行采样;(2)残差光线曲面模板——在一个固定模板 (若不存在标定信息,则取来自虚拟内参 、 的针孔曲面)周围学习 ,在 10 个 epoch 内将 从 0 逐渐提升到 1——这一针孔先验即便对折反射数据也能稳定训练;(3)基于图块的关联——训练时将搜索范围限制在目标像素周围半分辨率下的 网格内。测试时无需任何近似;全分辨率的光线曲面直接由网络给出。
实验结果
- KITTI(在接近针孔的数据上做健全性检验,测距范围 80 米内):采用完全学习式光线曲面的 NRS-ResNet(RS-L)达到 Abs Rel 0.134 / RMSE 5.263——与 Gordon 等人的学习式针孔方法(0.128 / 5.230)相当;NRS-PackNet 进一步提升到 Abs Rel 0.127 / Sq Rel 0.667 / RMSE 4.049。学习到的曲面在帧与帧之间保持稳定(测试集上的变异系数低于 2.5%)。
- Multi-FOV(合成鱼眼数据):Abs Rel 从针孔模型的 0.441 降至 NRS 的 0.225——下降 51%( 从 0.336 提升到 0.593)。
- OmniCam(折反射相机,360° 视场角):首个在折反射视频上学习里程计的自监督单目方法——ATE 为 0.035,而同一框架采用针孔投影时为 0.408(且会发散)。
- KITTI 里程计(序列 09/10,5 帧片段 ATE): / ,在完全不具备相机知识的情况下与经过标定的针孔模型相当。
- 在水下洞穴序列以及挡风玻璃后拍摄的鱼眼行车记录仪序列上给出了定性结果,而经过校正的针孔基线方法在这些场景中无法给出有意义的预测。
所有实验使用完全相同的架构和超参数——唯一变化的是训练视频本身。
对SLAM的意义
机器人携带的相机越来越多地无法用针孔模型很好地描述(无人机和汽车上的鱼眼相机、折反射相机装置),而为每台设备进行标定是一项部署成本。Neural Ray Surfaces 表明相机模型本身也可以作为又一个可学习的组件来处理——一个可微的逐像素光线场——从而将自监督深度/自我运动工具箱扩展到任意光学系统。这是朝着能够适应任意传感器的 SLAM 前端迈出的一步,也是跨异构光学系统实现免标定几何学习的参考点。
相关条目
- 超越针孔的相机模型 — 该方法用学习取代的经典模型
- SfM-Learner — 其所推广的自监督深度加自我运动框架
- Depth from Videos in the Wild — 从视频中学习内参这一密切相关的思路
- MonoDepth — 深度光度自监督方法的起源
- 相机标定 — NRS 所绕开的人工标定流程