LightGlue

Lindenberger 2023 · 论文

一句话总结 — 重新设计的SuperGlue,通过自适应深度和宽度大幅提速:简单的图像对提前退出网络,而被自信匹配或拒绝的特征点则从后续计算中被剪除。

问题

SuperGlue确立了学习型稀疏匹配作为最先进技术的地位,但它花费的是固定的计算预算:无论图像对的难度如何,每个特征点都要经过每一层,其Sinkhorn最优传输头开销很大且众所周知难以训练——后续工作未能达到原始模型的性能。LightGlue逐一重新审视SuperGlue的设计决策,推导出简单但有效的改进,并使推理能够根据每对图像的难度自适应调整。

方法与架构

给定来自图像AABB的局部特征(归一化位置pi[0,1]2\mathbf{p}_i \in [0,1]^2,描述子diRd\mathbf{d}_i \in \mathbb{R}^dd=256d{=}256),LightGlue堆叠了L=9L = 9个相同的层,每层由一个自注意力+一个交叉注意力单元(4个头)组成,用于更新逐点状态xi\mathbf{x}_i(初始化为di\mathbf{d}_i):

xiIxiI+MLP([xiImiIS])\mathbf{x}^{I}_{i} \leftarrow \mathbf{x}^{I}_{i} + \mathrm{MLP}\big(\big[\mathbf{x}^{I}_{i} \,\Vert\, \mathbf{m}^{I\leftarrow S}_{i}\big]\big)

其中miIS\mathbf{m}^{I\leftarrow S}_i是源图像SS中状态的注意力加权平均。

Pij=σiAσjBSoftmaxkA(Skj)iSoftmaxkB(Sik)j\mathbf{P}_{ij} = \sigma_i^A\, \sigma_j^B\, \mathrm{Softmax}_{k \in \mathcal{A}}(\mathbf{S}_{kj})_i\, \mathrm{Softmax}_{k \in \mathcal{B}}(\mathbf{S}_{ik})_j

对应关系是那些Pij\mathbf{P}_{ij}超过阈值且在其行和列上均为最大值的点对——这是互近邻搜索与学习到的内点分类器的融合,比最优传输便宜得多。

实验结果

对SLAM的意义

SuperGlue证明了学习型匹配比最近邻+比率检验更鲁棒,但其固定的计算预算使其在实时SLAM中显得笨拙。LightGlue的核心洞见——按问题难度分配计算量,在高重叠的跟踪帧上节省算力,在宽基线回环检测上深入计算——使学习型匹配在延迟敏感的流水线中变得实用,并取代SuperGlue成为hloc定位工具箱中的默认匹配器。如果你今天要构建一个现代的基于特征的SLAM或重定位流水线,SuperPoint(或DISK/SIFT)+ LightGlue是标准的起点。

相关条目