RoMa

Edstedt 2024 · 论文

一句话总结 — 鲁棒的稠密特征匹配方法,将冻结的DINOv2基础模型特征(鲁棒但粗糙)与专门的VGG19精细特征(精确但脆弱)融合在一个Transformer匹配解码器中,该解码器预测锚点概率,并采用”先分类回归再鲁棒回归”的方式训练。

问题

稠密特征匹配——为两幅图像间的每个像素估计一个稠密变形场WABW^{\mathcal{A}\to\mathcal{B}}以及可匹配性得分p(xA)p(x^{\mathcal{A}})——必须在尺度、光照、视角和纹理的极端真实世界变化下保持有效。在匹配数据上从头训练的特征(DKM的ResNet50)在空间上精确,但会对训练集过拟合;冻结的DINOv2特征则大幅更加鲁棒(论文测得在一个冻结特征的粗匹配探测任务上为27.1像素EPE/85.6%鲁棒性,而ResNet50为60.2/57.5%,VGG19为87.6/43.2%),但只存在于粗步幅14上。RoMa探究的问题是如何同时获得两者的优势,以及如何为每个阶段用与其误差特性相匹配的损失函数来训练。

方法与架构

两阶段稠密流水线(DKM骨架)。 解耦的编码器分别提取粗特征和精细特征;一个全局匹配器Gθ=Dθ(Eθ(φcoarseA,φcoarseB))G_\theta = D_\theta(E_\theta(\varphi^{\mathcal A}_{\text{coarse}}, \varphi^{\mathcal B}_{\text{coarse}}))生成粗变形场和置信度,随后在步幅{1,2,4,8}\{1,2,4,8\}上的细化器Rθ,iR_{\theta,i}利用堆叠的特征图和一个围绕前一估计的局部相关性体,递归地预测残差变形场和置信度对数偏移,各阶段之间的梯度被截断。

鲁棒且可定位的特征。 Fcoarse,θ=DINOv2F_{\text{coarse},\theta}=\text{DINOv2}(在整个训练过程中保持冻结——固定表示能减少过拟合并降低计算量),而Ffine,θ=VGG19F_{\text{fine},\theta}=\text{VGG19}:消融实验表明VGG19做粗特征效果差,但做精细特征效果最好,揭示了”精细可定位性与粗糙鲁棒性之间存在固有张力”。

带锚点概率的Transformer匹配解码器。 该解码器(5个ViT块,8个头,隐藏维度1024,不使用位置编码——仅通过特征相似度传播,以避免分辨率过拟合和过度平滑)不直接回归坐标,而是输出在K=64×64K = 64\times 64个均匀锚点上的离散化条件分布:

pcoarse,θ(xBxA)=k=1Kπk(xA)Bmk,p_{\text{coarse},\theta}(x^{\mathcal{B}}|x^{\mathcal{A}})=\sum_{k=1}^{K}\pi_k(x^{\mathcal{A}})\,\mathcal{B}_{m_k},

其中πk\pi_k为锚点概率,mkm_k为锚点坐标——因此多模态的歧义性(重复结构、运动边界)被表示出来,而不是被平均掉。变形场的解码方式是先在锚点上取argmax,再在4邻域N4(k)N_4(k^*)上做局部softargmax。

与各阶段相匹配的损失函数。 将尺度ss下的可匹配性建模为一个模糊化的联合分布q(xA,xB;s)=N(0,s2I)p(xA,xB;0)q(x^{\mathcal{A}},x^{\mathcal{B}};s)=\mathcal{N}(0,s^2\mathbf{I}) \ast p(x^{\mathcal{A}},x^{\mathcal{B}};0)表明,粗略条件分布在运动边界附近是多模态的,而细化过程(以前一变形场为条件)是局部单模态的。因此Lcoarse\mathcal{L}_{\text{coarse}}采用”分类式回归”——对最接近真值的锚点k(x)=argminkmkxk^{\dagger}(x)=\operatorname{argmin}_k \lVert m_k - x\rVert计算NLL——而Lfine\mathcal{L}_{\text{fine}}采用鲁棒的广义Charbonnier回归(α=0.5\alpha=0.5),其对数密度为(μθxiB2+s)1/4-(\lVert\mu_\theta - x_i^{\mathcal{B}}\rVert^2 + s)^{1/4}:局部呈L2式梯度,对异常值则衰减至零。总损失L=Lcoarse+Lfine\mathcal{L}=\mathcal{L}_{\text{coarse}}+\mathcal{L}_{\text{fine}},不需要跨阶段加权。在MegaDepth上以560×560训练(室内评估另加ScanNet模型)。

实验结果

对SLAM的意义

RoMa证明了冻结的基础模型特征能大幅提升匹配的鲁棒性——确立了”基础特征用于粗锚点+专用特征用于精度”的范式。对SLAM而言,这在严重外观变化(昼夜、季节)下的重定位和回环检测中最为重要,而稀疏的手工设计甚至学习式关键点在这些场合都会失效。如今,多个现代重建和定位流水线都以RoMa式的稠密匹配器为支撑。

相关条目