R2D2

Revaud 2019 · 论文

一句话总结 — 与稠密描述子一起联合学习显式的*重复性(repeatability)图和可靠性(reliability)*图,使得关键点只在真正能够被匹配的地方才被检测出来。

问题

经典局部特征遵循”先检测再描述”的范式:手工设计的检测器找出可重复的关键点,再由一个独立的描述子对其进行表示。学习式方法已经赶上了这一水平——用于检测的可重复显著性图,在这些位置上进行度量学习的描述子——但R2D2指出这混淆了两种不同的属性。显著区域不一定是有辨别力的:棋盘上的每一个方格、立面上的每一个窗口、树叶、海浪都能被一致地检测到,却因自相似性而匹配含糊。描述子应该只在能够高置信度完成匹配的地方才被信任(关键点也应只在这些地方才被检测)。

方法与架构

由单个FCN输出三个稠密结果。 对于一张H×WH \times W的图像,网络预测:稠密的L2归一化128维描述子X\boldsymbol{X},一张重复性热力图S[0,1]H×W\boldsymbol{S}\in[0,1]^{H\times W}(其局部极大值即为关键点候选),以及一张可靠性图R[0,1]H×W\boldsymbol{R}\in[0,1]^{H\times W}(估计每个描述子的辨别力)。骨干网络为L2-Net,将最后的8x8卷积替换为三个2x2卷积(权重数减少5倍);S\boldsymbol{S}R\boldsymbol{R}由逐元素平方、一个1x1卷积以及对128维输出做softmax得到。

重复性:自监督余弦相似度。 给定图像I,II, I'及其稠密真值对应关系UU,以及经UU变形后的第二张热力图SU\boldsymbol{S}'_U,两幅热力图在所有N×NN\times Npatch P\mathcal{P}上按patch方式对齐:

Lcosim(I,I,U)=11PpPcosim(S[p],SU[p])\mathcal{L}_{cosim}(I,I',U)=1-\frac{1}{|\mathcal{P}|}\sum_{p\in\mathcal{P}}cosim\bigl(\boldsymbol{S}\left[p\right],\boldsymbol{S}'_{U}\left[p\right]\bigr)

一个峰值性损失用于防止得到常数解的平凡解,并通过NN来设定关键点密度:

Lpeaky(I)=11PpP(max(i,j)pSijmean(i,j)pSij)\mathcal{L}_{peaky}(I)=1-\frac{1}{|\mathcal{P}|}\sum_{p\in\mathcal{P}}\Bigl(\max_{(i,j)\in p}\boldsymbol{S}_{ij}-\mathrm{mean}_{(i,j)\in p}\boldsymbol{S}_{ij}\Bigr)

两者合并为Lrep=Lcosim+λ(Lpeaky(I)+Lpeaky(I))\mathcal{L}_{rep}=\mathcal{L}_{cosim}+\lambda\left(\mathcal{L}_{peaky}(I)+\mathcal{L}_{peaky}(I')\right)

可靠性:带学习置信度的AP排序损失。 描述子匹配被视为一个排序问题:对每个查询像素,直接优化第二幅图像中候选点上平均精度(Average Precision)的可微近似,而不是三元组/对比式代理损失。关键之处在于,网络可以在不具辨别力的区域”选择放弃”:

LAPκ(i,j)=1[AP(i,j)Rij+κ(1Rij)]\mathcal{L}_{AP\kappa}(i,j)=1-\bigl[AP(i,j)\,\boldsymbol{R}_{ij}+\kappa\,(1-\boldsymbol{R}_{ij})\bigr]

其中κ=0.5\kappa=0.5为期望的最小AP:最优解在AP(i,j)<κAP(i,j)<\kappa处为Rij=0\boldsymbol{R}_{ij}=0,否则为1,因此R\boldsymbol{R}成为一个可解释的可匹配性概率。

训练数据与推理。 稠密对应关系可从网络图像上的随机单应变换中免费获得,也可来自一个光流流水线(EpicFlow配合极线约束的DeepMatching,并按匹配密度做掩码处理),应用于经SfM验证的Aachen图像对——无需人工标注。测试时,网络在一个尺度金字塔上运行(按21/42^{1/4}下采样),关键点取S\boldsymbol{S}的局部极大值,并按综合得分SijRij\boldsymbol{S}_{ij}\boldsymbol{R}_{ij}保留前KK个。

实验结果

对SLAM的意义

错误匹配是基于特征的SLAM在重复性结构(走廊、立面、植被)下的主要失效模式。R2D2确立了可靠性感知关键点选择的原则——重质不重量——这一原则延续到了后续的检测器/描述子设计中,并影响了现代流水线为定位和三维重建对对应关系进行评分和过滤的方式。

动手实践

相关条目