SuperPoint
DeTone 2017 · 论文
一句话总结 — 一种通过Homographic Adaptation(单应自适应)训练的自监督兴趣点检测器与描述子,在一次约70 FPS的前向推理中为整张图像同时输出关键点和256维描述子。
问题
经典的检测器与描述子(SIFT、ORB)是手工设计的,在光照和视角变化下表现脆弱,而对关键点进行监督学习又受制于一个尴尬的事实:与人体关键点不同,“兴趣点”这一概念在语义上是不明确的,因此不存在可供标注的真值。基于图像块的学习型描述子还需要在检测结果周围进行裁剪,这阻碍了高效的全图推理。SuperPoint探讨的问题是:如何在没有任何人工标签的情况下,在真实图像上训练一个联合的检测器+描述子,并让全卷积模型在一次前向推理中计算出像素级的关键点和描述子。
方法与架构
共享编码器,双头输出。 一个VGG风格的编码器(八个3x3卷积层,通道数为64-64-64-64-128-128-128-128,配合三次2x2最大池化)将的图像映射为一个的”格子”网格,其中,。两个解码头共享这一表示:
- 兴趣点解码器:计算——64个通道对应每个8x8像素格子内的位置,再加一个”无兴趣点”的垃圾桶通道。逐通道softmax配合一个无参数的重塑操作(亚像素卷积)恢复出全分辨率的”点性”热力图,从而避免了上卷积的开销和棋盘格伪影。
- 描述子解码器:计算半稠密的,再通过双三次插值和L2归一化,得到任意像素处的单位长度描述子。
合成预训练(MagicPoint)。 检测器路径首先在Synthetic Shapes(合成形状)数据上训练——渲染出的四边形、三角形、直线、椭圆,其角点位置在构造上是明确无歧义的。在这份数据上,MagicPoint在成像噪声下达到0.971的mAP,相比之下FAST为0.061,Harris为0.213,Shi-Tomasi为0.157。
Homographic Adaptation(单应自适应)。 为了跨越合成数据与真实数据之间的差距,理想的检测器应对单应变换具有协变性,即。由于真实检测器并非完全协变,响应结果需要在次随机单应变换上进行聚合:
以运行(超过此值收益递减:100次变换时可重复性提升21%,1000次时提升22%),在8万张240x320的MS-COCO图像上迭代运行两次,由此产生用于自监督训练的伪真值关键点——整个过程无需任何人工标签。
联合训练损失。 具有已知单应变换的图像对同时监督两个头:
是针对每个格子在65个类别上的交叉熵。描述子的铰链损失使用对应关系标签(当变换后的格子中心落在8个像素范围内时成立),边距设为,:
其中用于平衡稀少的正样本与大量的负样本,用于平衡两个损失项。
实验结果
- 运行速度:在480x640图像上(Titan X),单次前向推理约需11.15毫秒,加上CPU端约1.5毫秒的描述子采样——总计约13毫秒,即70 FPS。
- HPatches可重复性(240x320,300个点,NMS=4):在57个光照变化场景中,SuperPoint为0.652——所有方法中最优,相比Harris的0.620,FAST/MagicPoint的0.575;在59个视角变化场景中为0.503,与FAST(0.503)相当,低于Harris(0.556)但远高于MagicPoint(0.322)——Homographic Adaptation带来了视角鲁棒性。
- HPatches单应估计(1000个点,480x640):在下正确率为0.684,相比SIFT为0.676,LIFT为0.598,ORB为0.395。SuperPoint在描述子指标上占据主导:NN mAP为0.821,匹配得分为0.470,相比SIFT的0.694/0.313。得益于亚像素级精细化,SIFT在亚像素精度上仍保持优势(:0.424 vs 0.310)。
- ORB的原始可重复性最高,但其聚集式的检测结果导致单应估计效果最差——单靠可重复性并不能造就好的匹配器。
对SLAM的意义
SuperPoint成为深度SLAM时代事实上的学习型局部特征:在ORB失效的光照和视角变化场景下依然稳健,同时速度足够快,可用于实时前端。它是SuperGlue/LightGlue以及hloc定位生态系统所依赖的标准骨干网络,并已被植入类ORB-SLAM的系统中(例如DXSLAM在经典管线中使用了学习型特征)。Homographic Adaptation本身也成为几何学习领域广泛复用的自监督方案。