SuperPoint
DeTone 2017 · 論文
一行要約 — Homographic Adaptationによって自己教師あり学習された特徴点検出器・記述子であり、画像全体に対して1回の順伝播(約70 FPS)でキーポイントと256次元記述子を生成する。
問題
古典的な検出器・記述子(SIFT、ORB)は手作りで、照明変化や視点変化に対して脆弱である。一方、キーポイントの教師あり学習は厄介な事実によって妨げられている。人体キーポイントとは異なり、「特徴点」という概念はそもそも意味的に定義があいまいであり、そのためアノテーションを行うための正解データが存在しない。パッチベースの学習済み記述子も、検出箇所周辺のクロップを必要とし、画像全体に対する効率的な推論を妨げていた。SuperPointは、人手によるラベルを一切使わずに、実画像上で検出器と記述子を同時に学習する方法を問い、1回の順伝播でピクセル単位のキーポイントと記述子を計算する完全畳み込みモデルを提案する。
手法とアーキテクチャ
共有エンコーダ、2つのヘッド。 VGG風のエンコーダ(8層の3x3畳み込み層、64-64-64-64-128-128-128-128、3回の2x2最大プーリングを含む)が、の画像を、、の「セル」からなるグリッドに写す。2つのデコーダヘッドがこの表現を共有する。
- 特徴点デコーダ: を計算する。各8x8ピクセルセル内の位置を表す64チャンネルに加え、「特徴点なし」を表すダストビンチャンネルを持つ。チャンネル方向のソフトマックスとパラメータフリーなリシェイプ(サブピクセル畳み込み)によって、アップコンボリューションのコストやチェッカーボードアーティファクトを避けながら、フル解像度のポイントらしさヒートマップを復元する。
- 記述子デコーダ: セミデンスなを計算し、双三次補間とL2正規化によって、任意のピクセルにおける単位長の記述子を得る。
合成データによる事前学習(MagicPoint)。 検出器の経路はまずSynthetic Shapesで学習される。これは、構造上コーナー位置が一意に定まる四角形、三角形、直線、楕円をレンダリングしたデータである。このデータ上でMagicPointは撮像ノイズ下で0.971 mAPを達成する(FAST 0.061、Harris 0.213、Shi-Tomasi 0.157に対して)。
Homographic Adaptation。 合成データと実データのギャップを越えるには、理想的な検出器はホモグラフィに対して共変であるべきである:。実際の検出器は完全には共変ではないため、個のランダムなホモグラフィ変形に対する応答を集約する。
で実行すると(それ以上では効果が減少する:100回の変形で再現性+21%、1000回で+22%)、80kのMS-COCO画像(240x320)に対してこれを2回繰り返し適用することで、擬似正解キーポイントが生成される。人によるラベル付けは一切ない自己教師あり学習である。
同時学習損失。 既知のホモグラフィで変形された画像のペアが両方のヘッドを同時に教師する。
は65クラスに対するセル単位の交差エントロピーである。記述子のヒンジ損失は、変形後のセル中心が8ピクセル以内に収まる場合にとなる対応関係ラベルを使い、マージン、を用いる。
ここでは少数の正例と豊富な負例のバランスを取り、は2つの損失のバランスを取る。
実験結果
- 実行時間: 480x640画像での1回の順伝播は約11.15 ms(Titan X)、加えてCPU上の記述子サンプリングに約1.5 ms — 合計約13 ms、すなわち70 FPS。
- HPatches再現性(240x320、300点、NMS=4): 照明変化57シーンでSuperPointは0.652で全手法中最高(Harris 0.620、FAST/MagicPoint 0.575に対して)。視点変化59シーンでは0.503で、FAST(0.503)と同程度、Harris(0.556)には及ばないが、MagicPoint(0.322)を大きく上回る — Homographic Adaptationが視点ロバスト性をもたらしている。
- HPatchesホモグラフィ推定(1000点、480x640): での正解率は0.684で、SIFT 0.676、LIFT 0.598、ORB 0.395に対して優位。SuperPointは記述子の指標で圧倒的に優れ、NN mAPは0.821、マッチングスコアは0.470(SIFTの0.694 / 0.313に対して)。サブピクセル精度()ではSIFTがサブピクセル精緻化のおかげで優位を保つ(0.424 対 0.310)。
- ORBは生の再現性は最も高いが、検出が密集しているためホモグラフィ推定は最悪になる — 再現性だけでは良いマッチャーにはならない。
SLAMにおける意義
SuperPointは深層学習SLAM時代における標準的な学習済みローカル特徴となった。ORBが苦手とする照明変化や視点変化に対してロバストでありながら、リアルタイムのフロントエンドに十分なほど高速である。SuperGlue/LightGlueやhlocの位置認識エコシステムの標準的なバックボーンであり、ORB-SLAM風のシステム(例えばDXSLAMは古典的パイプライン内で学習済み特徴を使用する)にも組み込まれている。Homographic Adaptation自体も、幾何学的学習における広く再利用される自己教師あり学習のレシピとなった。