R2D2
Revaud 2019 · 論文
一行要約 — 密な記述子と並行して明示的な*repeatability(再現性)マップとreliability(信頼性)*マップを共同で学習し、実際にマッチング可能な場所でのみ特徴点を検出する。
問題
古典的な局所特徴は検出してから記述するというパラダイムに従う: 手作りの検出器が再現性のある特徴点を見つけ、別の記述子がそれを表現する。学習ベースの手法はこれに追いついており — 検出のための再現性のあるサリエンシーマップ、それらの位置でのメトリック学習された記述子 — しかしR2D2は、これが2つの異なる性質を混同していると主張する。サリエントな領域は必ずしも識別的ではない: チェッカーボードのすべての正方形、ファサードのすべての窓、樹木の葉、海の波は一貫して検出されるものの、自己相似性のためにマッチングが曖昧になる。記述子は、高い確信を持ってマッチングが行える場所でのみ信頼されるべきであり(そして特徴点もそこでのみ検出されるべきである)。
手法とアーキテクチャ
1つのFCNからの3つの密な出力。 の画像に対して、ネットワークは以下を予測する: 密なL2正規化128次元記述子 、局所最大値が特徴点候補となる再現性ヒートマップ 、そして各記述子の識別性を推定する信頼性マップ である。バックボーンはL2-Netであり、最終的な8x8畳み込みが3つの2x2畳み込みに置き換えられている(重みが5分の1に削減)。 と は要素ごとの2乗、1x1畳み込み、128次元出力に対するsoftmaxから得られる。
再現性: 自己教師あり コサイン類似度。 密な正解対応関係 を持つ画像 と、 でワーピングされた2番目のヒートマップ が与えられた場合、マップはすべての パッチ にわたってパッチごとに整合される:
自明な定数解を防ぎ、によって特徴点密度を設定するピーキネス損失:
これらを組み合わせて とする。
信頼性: 学習された確信度を持つAPランキング損失。 記述子マッチングはランキング問題として扱われる: 各クエリピクセルについて、triplet/contrastive代替損失ではなく、2番目の画像内の候補に対するAverage Precisionの微分可能な近似を直接最適化する。重要なのは、ネットワークが識別性のない領域では「不参加」を選べる点である:
ここで は最小期待APである: 最適解は の場所で 、それ以外で1となるため、 は解釈可能なマッチング可能性の確率となる。
学習データと推論。 密な対応関係は、Web画像に対するランダムなホモグラフィから無料で得られるほか、Aachenの画像ペア(SfMで検証済み)に対するオプティカルフローパイプライン(エピポーラ制約付きDeepMatchingを用いたEpicFlow、マッチング密度でマスク)からも得られる — 手動ラベルは一切不要である。テスト時にはネットワークがスケールピラミッド上で実行され(でダウンサンプリング)、特徴点は の局所最大値であり、上位 個が結合スコア によって保持される。
実験結果
- アブレーション(HPatches): フルモデルはM-score 0.461/MMA@3 0.686に到達する。再現性マップを除くと0.304/0.512まで性能が崩壊する — 再現性と信頼性は本当に異なる信号であることを示している。信頼性を除くとM-scoreが3%低下する。
- HPatches MMA: 中程度の閾値でSuperPoint、D2-Net(マルチスケール)、LF-Net、HAN+HN++、Hessian-affine+RootSIFTを上回る。照明のみの変化を持つペアではDELFのみが勝る(その固定特徴点グリッドは空間変化のない画像に対して自明にマッチングする)。M-score 3pxで0.425、LF-Netの0.335、SIFTの0.288に対して。
- 検出器の再現性(Oxford): 例えばwall(視点変化)で0.62-0.71であり、300〜3000点にわたってQuadNetの0.30-0.46、DoGの0.27-0.28を上回る。
- Aachen Day-Nightローカリゼーション(CVPR19局所特徴チャレンジ、COLMAPパイプライン): 最良モデル(N=8、10kの特徴点、100万重み)は、夜間クエリの**45.9/66.3/88.8%**を(0.25m, 2°)/(0.5m, 5°)/(5m, 10°)以内にローカライズする — 新記録であり、D2-Net(44.9/66.3/88.8、1500万重み、128次元)とSuperPoint(42.8/57.1/75.5)を上回る。5kの特徴点を持つバリアントでさえ、半分の特徴点数でほとんどの手法を上回り、128次元記述子と最大15倍小さいネットワークのみを用いる。
SLAMにおける意義
誤ったマッチングは、繰り返し構造(通路、ファサード、植生)下での特徴ベースSLAMの主要な失敗モードである。R2D2は信頼性を考慮した特徴点選択 — 量より質 — の原則を確立し、これは後の検出器/記述子設計や、現代のパイプラインがローカリゼーションと3D再構成のために対応関係をスコア付け・フィルタリングする方法に受け継がれた。
ハンズオン
関連ノート
- SuperPoint — 自己教師あり共同検出器/記述子ベースライン
- DISK — 強化学習で学習された代替手法
- KeyNet — 学習ベース検出器の系譜
- DeDoDe — 検出と記述の後期分離
- hloc — このような特徴が評価されるローカリゼーションパイプライン