ACE
Brachmann 2023 · 論文
一行要約 — Accelerated Coordinate Encoding は、ネットワークをシーン非依存の事前学習済みエンコーダとシーン固有の小さな MLP ヘッドに分割することで、シーン座標回帰の学習時間を数時間からシーンあたり約5分に短縮した。
問題
学習ベースの視覚的再局在化手法は最高水準の姿勢精度を示すが、学習に数時間から数日を要する——さらに新しいシーンごとに学習をやり直す必要があるため、長い学習時間が高精度という利点をほとんどのアプリケーションで実用性のないものにしていた。デプロイのボトルネックはクエリフェーズではなくマッピングフェーズにあった。最先端の SCR パイプラインである DSAC* は、1シーンをマッピングするのにプレミアム GPU で15時間を要する。
手法とアーキテクチャ
設定。 DSAC系統と同様、姿勢は から得られる。ここで は PnP + RANSAC ソルバー(64個の仮説、10 px の内点閾値、LM refinement)であり、 は画像パッチ に作用するシーン座標回帰器 によって予測される2D-3D対応である。ACE はこれを完全に維持しており——その貢献は の学習を2桁高速化したことにある。
バックボーン/ヘッドの分割。 回帰器は次のように因数分解される。
ここで はシーン非依存の畳み込みバックボーン(DSAC*設計の最初の10層、512次元特徴、100個の ScanNet シーンに対して100個の並列ヘッドで1週間かけて一度だけ事前学習——11 MB、デプロイ時は固定)であり、 は1x1畳み込みからなるシーン固有の512幅の MLP ヘッドである——この4 MB のヘッド自体がマップとなる。
勾配の非相関化——キーアイデア。 標準的な SCR 学習では1イテレーションにつき1枚の画像を入力するため、すべてのパッチ勾配が強く相関する。MLP ヘッドには空間的コンテキストが不要なため、ACE は代わりに最初の1分間で800万個のバックボーン特徴量(ピクセル位置、内部パラメータ、正解姿勢付き)からなる学習バッファを事前計算し、各エポックでシャッフルして、数千の異なるマッピング視点から抜き出した5120個の特徴量のバッチを構築する。したがって各パラメータ更新はシーン全体を同時に最適化することになる——非相関化された勾配は非常に高い学習率(AdamW、 から の間の one-cycle スケジュール)を許容し、16エポック/4分で収束する。
エンドツーエンド学習の代わりのカリキュラム。 微分可能な姿勢ソルバーを通した高コストな逆伝播(DSAC*の学習時間の半分を占めるが更新の10%にしか相当しない)を、ピクセル単位の再投影損失に対するカリキュラムで置き換える。有効な予測は でクランプされた再投影誤差を最適化する。
閾値は学習の進行度 に応じて px から px に縮小していく——ネットワークは信頼できる構造にまず慣れ、いずれにせよ RANSAC が棄却するような予測を放棄する。無効な予測は深度10 mのダミー座標へ回帰する。学習は fp16 で実行され、ヘッドは softplus w-clip を用いて同次座標 を予測し、これは難しいシーンで一貫して有効である。深度も3Dモデルも不要——姿勢付き RGB のみである。
実験結果
- ヘッドライン: シーンあたり5分未満の学習で、はるかに遅い先行 SCR 手法と同等の精度を達成——最先端 SCR に対して最大300倍高速なマッピング、マップサイズは4 MB(DSAC*: 15時間、28 MB; hLoc は7Scenesの1シーンあたり約3.3 GB、Cambridgeで約800 MBを保存)。
- 7Scenes / 12Scenes(5 cm/5°閾値、SLAM と SfM の両方の正解データ): ACE は最高精度、10分未満のマッピング、シーンあたり10 MB未満を兼ね備える唯一の手法であり——DSAC* と同水準である(表1)。約80%の精度は既に1エポック(75秒)後に達成され、2.5 MBのヘッドでも7Scenesで95%を超える。
- Cambridge Landmarks: ACE は4 MBで妥当な性能を示し、4個の ACE ヘッドからなる「Poker」アンサンブルは平均中央誤差で DSAC* を上回りつつ、マッピング時間とストレージでは依然としてはるかに軽量である。
- Wayspots(電話スキャンによる新しい10シーンの屋外ベンチマーク、Map-free 方式の SfM 正解データ、10 cm/5°): ACE は平均で DSAC* を上回りつつ、2桁高速にマッピングする。
- ハードウェア: 低価格な T4 GPU 上では ACE の速度低下はわずか約10%であるのに対し、DSAC* のマッピングは約30時間へと倍増する——マッピングコストとエネルギーは2桁減少する。
SLAMにおける意義
ACE はシーン座標回帰を研究上の興味の対象から、デプロイ可能な再局在化ツールへと変えた。コンパクトで暗黙的、プライバシーに配慮した(画像や点群を保存しない)シーン表現を、姿勢付き RGB のみから現場で数分で学習できる——これはまさに携帯端末規模の視覚オドメトリが提供するものである。これは活発な系譜の基盤となっている——ACE Zero は既知の姿勢を不要にし、ACE-G はシーンごとの微調整なしでの汎化を目指し、ACE-SLAM はこの表現をリアルタイム SLAM ループへと発展させ、ネットワークの重みそのものがマップとなる。