LoFTR
Sun 2021 · 論文
一行要約 — Transformerを用いた検出器不要の稠密特徴マッチング: 自己注意と交差注意が両画像の特徴を条件付け、キーポイント検出器が失敗するテクスチャの乏しい領域でも信頼できるマッチを生成する。
問題
古典的なパイプラインは特徴の検出、記述、マッチングを順に実行するため、すべてが検出器が両画像で再現可能な興味点を生成することに依存する——検出器は低テクスチャ領域(何も無い壁、床)や繰り返しパターンの下でこれに失敗することが知られている。既存の稠密な代替手法はコストボリュームを通じて対応点を探索するが、これは高コストであり、依然としてローカルな根拠に依存している。LoFTRは検出を完全に省略する: まず粗いレベルで画素単位の稠密マッチを確立し、良いものだけを洗練する——Transformerの大域的な受容野が両画像を一度に条件付けて何がマッチするかを決定する。
手法とアーキテクチャ
バックボーン。 ResNet-18 + FPNのCNNが1/8解像度で粗い特徴を、1/2解像度で細かい特徴を抽出する。
LoFTRモジュール。 2Dの正弦波位置エンコーディング(1回だけ加算)が特徴を位置に依存させる——特徴の乏しい領域をマッチングするために重要である。その後、個の交互に配置された自己注意・交差注意層が粗い特徴をに変換する。通常の注意はのコストがかかるため、LoFTRはLinear Transformerカーネルを用いる:
これは行列積の結合性(まずを計算する、特徴次元)により、コストをに削減する。
粗いマッチング。 スコア行列は、最適輸送層(SuperGlueと同様)またはデュアルソフトマックスのいずれかに入力される:
粗いマッチは、において確信度で相互最近傍となるペアである。
粗から細への洗練。 各粗いマッチについて、のローカルウィンドウが細かい特徴マップから切り出され、より小さなLoFTRモジュール()によって変換される。クエリウィンドウの中心ベクトルを他のウィンドウと相関させることで、マッチング確率のヒートマップが得られ、その期待値がサブピクセル位置を与える。
教師信号。 : (SuperGlueと同様に姿勢+深度から得られる)正解の粗いグリッドマッチに対する負の対数尤度に加えて、細かいオフセットに対するヒートマップ分散重み付き損失:
コスト。 デュアルソフトマックスでRTX 2080Ti上で640×480ペアあたり116ms(最適輸送では130ms)。エンドツーエンドでスクラッチから学習、屋内モデルで64台のGTX 1080Ti GPUを用いて24時間。
実験結果
- HPatchesホモグラフィ: AUC@3px 65.9(SuperPoint+SuperGlueの53.9、DRC-Netの50.6に対して)——マージンは閾値が厳しくなるほど拡大する。
- 屋内姿勢(ScanNet、1500テストペア): LoFTR-DSのAUC@5°/10°/20° = 22.06/40.8/57.62(SuperPoint+SuperGlueの16.16/33.81/51.84、DRC-Netの7.69/17.93/30.49に対して)——まさに低テクスチャで広ベースラインの屋内シーンで最大の改善が見られる。
- 屋外姿勢(MegaDepth): LoFTR-DS 52.8/69.19/81.18(SuperPoint+SuperGlueの42.18/61.16/75.96に対して、AUC@10°で13%改善)、検出器不要のDRC-NetよりAUC@10°で61%改善。
- 視覚的位置推定: 発表当時、Long-Term Visual Localizationベンチマークの2つのトラックで発表済み手法中1位——Aachen v1.1夜間ローカル特徴トラック(LoFTR-DS 72.8/88.5/99.0)で最良、InLoc(DUC1 47.5/72.2/84.8、DUC2 54.2/74.8/85.5、hloc使用)で発表済み手法中最良。
- アブレーション: LoFTRモジュールを同等パラメータ数の畳み込みに置き換えるとAUCが大幅に低下する(@5°で14.98対22.06)。DETR型の層ごとの位置エンコーディングも性能を悪化させる。
SLAMにおける意義
屋内SLAMは、検出すべきものが何もない場所——何もない壁、床、繰り返しの表面——で常に失敗する。LoFTRは、大域的コンテキストを持つマッチャーがそこでも対応点を生成できることを示し、RoMaやEfficientLoFTRなど多くの後継が基盤とする検出器不要のパラダイムを確立した。実際には、疎マッチングが脆すぎる場合の屋内再構成、広ベースライン再定位、ループクロージャ検証における第一選択であり、疎マッチャーより多くの計算を必要とする代償を伴う。
関連ノート
- SuperGlue — 疎な学習型マッチングの対応手法
- LightGlue — 高速な疎マッチャー; 効率重視の代替手法
- RoMa — 基盤モデルの特徴を用いた稠密マッチング
- SuperPoint — LoFTRが回避する検出器ベースのパラダイム
- HF-Net — 検出器不要マッチャーが組み込まれる視覚的位置推定パイプライン