GLOMAP

Pan 2024 · 论文

一句话总结 — 重新审视了全局Structure-from-Motion,证明它在精度上可以与增量式SfM(COLMAP)相匹敌,同时速度大幅提升,其关键在于用一个联合的相机-点全局定位步骤取代了独立的平移平均步骤。

问题

SfM方案分为两大流派。增量式SfM(COLMAP)逐张注册图像,并反复进行光束法平差;它精度高、鲁棒性好,但其”代价高昂的反复光束法平差”限制了可扩展性。全局SfM一次性恢复所有相机,速度”快出几个数量级”,但精度始终无法与增量式方法匹敌——差距”在于全局平移平均这一步骤”,该步骤受到双视图平移尺度歧义(倾斜的三元组会放大噪声)、需要精确内参才能分解双视图几何,以及在序列数据中常见的近共线(前向)运动下的退化问题的困扰。GLOMAP旨在弥合这一差距。

方法与架构

包含两个组件:对应搜索(特征、匹配、双视图几何F/E/H\mathbf{F}/\mathbf{E}/\mathbf{H}、视图图标定、相对位姿估计)以及全局估计

arg minRi,jρ(d(RjRijRi,I)p)\operatorname*{arg\,min}_{\mathbf{R}}\sum_{i,j}\rho\left(d(\mathbf{R}_{j}^{\top}\mathbf{R}_{ij}\mathbf{R}_{i},\mathbf{I})^{p}\right)

使用作者自己实现的Chatterjee等人方法;与该结果不一致的相对姿态(通过Rij\mathbf{R}_{ij}RjRi\mathbf{R}_{j}\mathbf{R}_{i}^{\top}之间的角度距离衡量)会被过滤掉。

arg minX,c,di,kρ(vikdik(Xkci)2),s.t.dik0\operatorname*{arg\,min}_{\mathbf{X},\mathbf{c},d}\sum_{i,k}\rho\left(\|\mathbf{v}_{ik}-d_{ik}(\mathbf{X}_{k}-\mathbf{c}_{i})\|_{2}\right),\quad\text{s.t.}\quad d_{ik}\geq 0

使用Huber损失ρ\rho,通过Levenberg–Marquardt(Ceres)求解,所有变量在[1,1][-1,1]均匀随机初始化,dik=1d_{ik}=1。对于最优的dikd_{ik},每一项误差在角度θ<π/2\theta<\pi/2时等于sinθ\sin\theta,超过该范围则饱和为1——这是一个有界的、对外点鲁棒的误差,得益于其双线性形式而能从随机初始化可靠收敛。由于误差定义在相机光线而非相对平移上,不准确的内参只会偏移单个相机,而前向/侧向运动也不再退化。

实验结果

对SLAM的意义

像COLMAP这样的SfM工具是生成真值轨迹、离线地图以及NeRF/3DGS与基于学习的SLAM训练数据的标准方式。GLOMAP让这一离线建图步骤在大规模场景下的成本大幅降低,并在增量式流程被普遍认为是唯一可靠选择长达十年之后,重新确立了全局SfM作为一种可靠的通用范式的地位——这条路线由GPU原生系统InstantSfM等接续下去。从概念上讲,其”一次性求解所有变量”的立场与SLAM后端的全局光束法平差如出一辙,而其基于光线的全局定位方法表明,重新构建一个脆弱的估计步骤(平移平均)可能比单纯优化它更为关键。

相关条目