LightGlue

Lindenberger 2023 · 논문

한 줄 요약 — 적응적 깊이와 너비를 통해 훨씬 더 빨라진, 재설계된 SuperGlue: 쉬운 이미지 쌍은 조기에 네트워크를 빠져나오고, 확신 있게 매칭되거나 거부된 keypoint는 이후 계산에서 제거된다.

문제

SuperGlue는 학습된 희소 매칭을 state of the art로 확립했지만, 고정된 연산 예산을 소비한다: 모든 keypoint는 이미지 쌍이 얼마나 쉬운지와 무관하게 모든 레이어를 통과하며, Sinkhorn optimal-transport head는 비용이 크고 학습하기가 유난히 어렵다 — 후속 연구들은 원래 모델의 성능에 도달하지 못했다. LightGlue는 SuperGlue의 설계 결정들을 하나씩 재검토하여 단순하지만 효과적인 개선을 이끌어내고, 각 쌍의 난이도에 맞춰 추론을 적응적으로 만든다.

방법 및 아키텍처

이미지 AABB로부터 얻은 지역 특징(정규화된 위치 pi[0,1]2\mathbf{p}_i \in [0,1]^2, descriptor diRd\mathbf{d}_i \in \mathbb{R}^d, d=256d{=}256)이 주어지면, LightGlue는 L=9L = 9개의 동일한 레이어를 쌓으며, 각 레이어는 self-attention 하나 + cross-attention 하나(4개 head)로 point별 상태 xi\mathbf{x}_i(초기값 di\mathbf{d}_i)를 갱신한다:

xiIxiI+MLP([xiImiIS])\mathbf{x}^{I}_{i} \leftarrow \mathbf{x}^{I}_{i} + \mathrm{MLP}\big(\big[\mathbf{x}^{I}_{i} \,\Vert\, \mathbf{m}^{I\leftarrow S}_{i}\big]\big)

여기서 miIS\mathbf{m}^{I\leftarrow S}_i는 source 이미지 SS의 상태에 대한 attention 가중 평균이다.

Pij=σiAσjBSoftmaxkA(Skj)iSoftmaxkB(Sik)j\mathbf{P}_{ij} = \sigma_i^A\, \sigma_j^B\, \mathrm{Softmax}_{k \in \mathcal{A}}(\mathbf{S}_{kj})_i\, \mathrm{Softmax}_{k \in \mathcal{B}}(\mathbf{S}_{ik})_j

대응점은 Pij\mathbf{P}_{ij}가 임계값을 넘고 자신의 행과 열에서 최댓값인 쌍이다 — 상호 최근접 이웃 탐색과 학습된 inlier 분류기의 융합으로, optimal transport보다 훨씬 저렴하다.

실험 결과

SLAM에서의 의미

SuperGlue는 학습된 매칭이 최근접 이웃 + ratio test보다 더 강인함을 입증했지만, 고정된 연산 예산 때문에 실시간 SLAM에는 부담스러웠다. LightGlue의 통찰 — 연산량을 문제 난이도에 비례해서 쓰고, overlap이 큰 tracking 프레임에는 저렴하게, wide-baseline loop closure에는 깊게 쓴다 — 는 학습된 매칭을 지연에 민감한 파이프라인에서도 실용적으로 만들었으며, hloc 위치추정 툴박스에서 기본 매처로 SuperGlue를 대체했다. 오늘날 현대적인 특징 기반 SLAM이나 재위치추정 파이프라인을 구축한다면, SuperPoint(또는 DISK/SIFT) + LightGlue가 표준적인 출발점이다.

관련 문서