RoMa
Edstedt 2024 · 論文
一行要約 — 凍結されたDINOv2基盤モデルの特徴(ロバストだが粗い)と、専用のVGG19ファイン特徴(精密だが脆弱)を融合し、アンカー確率を予測するTransformerマッチデコーダで密な特徴マッチングを行う手法。regression-by-classificationに続いてロバスト回帰で学習される。
問題
密な特徴マッチング — 2つの画像間のすべてのピクセルについて密なワープ とマッチング可能性スコア を推定すること — は、スケール、照明、視点、テクスチャにおける極端な実世界の変化を乗り越えなければならない。マッチングデータからスクラッチで学習された特徴(DKMのResNet50)は空間的に精密だが学習セットに過学習する。凍結されたDINOv2特徴は劇的にロバストである(本論文はResNet50の60.2px/57.5%、VGG19の87.6px/43.2%に対して、凍結特徴の粗いマッチングプローブで27.1px EPE/85.6%のロバスト性を測定している)が、粗いストライド14でのみ存在する。RoMaは両方を得る方法、そして各段階を自身の誤差レジームに合致した損失で学習する方法を問う。
手法とアーキテクチャ
2段階の密なパイプライン(DKM骨格)。 分離されたエンコーダが粗い特徴とファイン特徴を抽出する。グローバルマッチャー が粗いワープと確信度を生成し、その後ストライド のリファイナー が、積み重ねられた特徴マップと前の推定値周辺のローカル相関ボリュームを用いて残差ワープと確信度ロジットオフセットを再帰的に予測する。段階間で勾定は切り離される。
ロバストかつ局所化可能な特徴。 (学習全体を通して凍結 — 表現を固定することで過学習が減り計算量が削減される)、一方 : アブレーションはVGG19が粗い特徴としては貧弱だが最良のファイン特徴を作ることを示しており、「ファインな局所化可能性と粗いロバスト性の間の内在的な緊張関係」を明らかにしている。
アンカー確率を持つTransformerマッチデコーダ。 座標を直接回帰する代わりに、デコーダ(5個のViTブロック、8ヘッド、隠れサイズ1024、位置エンコーディングなし — 解像度への過学習と過度な平滑化を避けるため特徴類似度のみで伝播する)は、 個の均一アンカーに対する離散化された条件付き分布を出力する:
はアンカー確率、 はアンカー座標である — したがって(繰り返し構造や運動境界による)多峰性の曖昧さは平均化されるのではなく表現される。ワープはアンカーに対するargmaxによって復号され、続いて4近傍 に対するローカルsoftargmaxが行われる。
各段階に合致した損失。 スケール でのマッチング可能性を、ぼかされた結合分布 としてモデル化すると、粗い条件付き分布は運動境界付近で多峰的であるのに対し、(前のワープに条件付けられた)精緻化は局所的に単峰的であることが分かる。したがって はregression-by-classificationである — 正解に最も近いアンカー のNLL — であり、 はロバストな一般化Charbonnier回帰()であり、その対数密度は である: 局所的にはL2的な勾定を持ちながら外れ値に対してはゼロへ減衰する。全体損失 は段階間の重み付けを必要としない。560×560でMegaDepth(+屋内評価用ScanNetモデル)で学習。
実験結果
- アブレーション(MegaDepth検証セットでの100−PCK@5px、低いほど良い): DKMベースライン5.8 → 分離エンコーダ4.5 → +DINOv2粗特徴3.2 → +regression-by-classification 2.8 → +ロバスト精緻化損失2.7(フルRoMa)。Transformerデコーダをコンブネットに戻すと3.5に悪化する。
- WxBS(極端な広範囲多要因ベースライン): mAA@10pxで80.1、DKMの58.9、LoFTRの55.4に対して — 従来の最先端技術に対する36%の向上。
- IMC2022: mAA@10で88.0、DKMの83.1に対して — 26%の相対誤差削減。
- MegaDepth-1500 姿勢: AUC@5°/10°/20°で62.6/76.7/86.3(DKM 60.4/74.9/85.1)。MegaDepth-8-Scenes: 62.2/75.9/85.3。
- ScanNet-1500 姿勢: 31.8/53.4/70.9 — AUC@20°で70を超えた最初の手法。
- InLoc 視覚ローカリゼーション: DUC1 60.6/79.3/89.9、DUC2 66.4/83.2/87.8 — 最先端。
- 実行時間: DKMよりわずか7%遅い(560×560、バッチ8、RTX 6000で186.3ミリ秒→198.8ミリ秒/ペア)。
SLAMにおける意義
RoMaは、凍結された基盤モデルの特徴がマッチングのロバスト性を劇的に向上させることを示し — 「粗いアンカーのための基盤特徴+精度のための専用特徴」というパラダイムを確立した。SLAMにおいてこれが最も重要となるのは、疎な手作りあるいは学習ベースの特徴点でも失敗するような、深刻な外観変化(昼夜、季節)下でのリローカリゼーションとループ閉じ込みである。密なRoMaスタイルのマッチャーは、現在いくつもの現代的な再構成・ローカリゼーションパイプラインを支えている。
関連ノート
- RoMa v2 — 「より難しく、より良く、より速く、より密に」を実現した後継
- LoFTR — より早期の検出器フリーTransformerマッチング
- DeDoDe — 同じグループによる分離型の検出/記述
- Foundation models — 凍結された事前学習特徴が汎化する理由
- MASt3R — 3D再構成と融合した密なマッチング