ACE-G
Bruns 2025 · 論文
一行要約 — シーン座標回帰を、シーン非依存のクロスアテンション回帰器とシーン固有の「地図コード」に分割し、明示的なマッピング→クエリの目的関数を用いて数万のシーンで回帰器を事前学習することで、マッピング時には見られなかったクエリ条件にも再位置特定が一般化できるようにする(ICCV 2025)。
問題
数分のシーン固有学習の後、SCRモデルはクエリ画像のカメラポーズを高精度に推定できる — しかし、それでも古典的な特徴マッチング手法の汎化性能には及ばない。クエリ画像の撮影条件(照明、視点)が学習ビューと大きく異なる場合、SCRモデルは失敗する。これは従来のSCRフレームワークに内在する限界である。その学習目的が座標回帰器の重み自体に学習ビューを符号化することであるため、回帰器は設計上学習ビューに過学習してしまう。
手法とアーキテクチャ
ACEは、シーン非依存の畳み込み画像エンコーダとシーン固有のMLPヘッドから構成される。ACE-GはこのMLPを、シーン固有の地図コード を条件とするシーン非依存の座標回帰器 に置き換える。
ここで はDINOv2画像エンコーダによるパッチ埋め込みであり、 は予測されたシーン座標である。回帰器は 個のクロスアテンションのみのトランスフォーマーブロックのスタックである — パッチ埋め込みがクエリトークンとして機能し、地図埋め込みがキー/バリューとして機能する(位置エンコーディングはないため、地図コードは順序不変である)— その後に、 とラプラス不確実性 を出力する2層MLPが続く。
マッピング/クエリ事前学習。 学習セットは、マッピングバッファ と、真値座標を持つ非重複のクエリバッファ (異なる視点、照明、オブジェクト配置)のタプルの集合である。学習は2種類の反復を交互に行う。
- マッピング反復は、ラプラス負対数尤度を用いて、マッピングバッファ上でネットワーク と地図コード を同時に最適化する。
- クエリ反復は、クエリバッファ上で同じ損失を最小化するが、地図コードを固定した状態で のみを更新する — これにより、回帰器がマッピングデータ(地図コードに保存されている)から未見のクエリビューへ明示的に汎化するように強制される。
ネットワークは10回の反復ごとに1回だけ更新される(それ以外の9回は地図コードが更新される)。また、特定の地図コードへの過学習を避けるため、アクティブなプールからシーンを繰り返し最初からマッピングし直す。事前学習には数万のスキャンを用いる: ScanNet(1201)、ScanNet++(199)、ARKitScenes(4520)、MapFree(2×400)、BlendedMVS(462)、WildRGBD(22359)。
新規シーンのマッピング。 ランダムに初期化された地図コードのみが最適化され、2D再投影誤差の不確実性重み付きNLL を最小化する — このため、マッピング時に真値の3Dは不要であり、マッピングはACEと同様に数分で完了する。
再位置特定。 1回の順伝播で、不確実性付きの2D-3D対応が得られる。対応は適応的な閾値 (不確実性の最下位 分位、、)で事前フィルタリングされ、PnP + RANSACに渡される — これは古典的SCRと同じ出力インターフェースである。
実験結果
- Indoor-6(5°/25cm以内のフレームの割合、cm/°の中央値、シーンにわたる平均): 5分マッピング群では、ACE-Gは95 / 4.5 / 0.8を記録し、DINO-ACE(DINOv2特徴上のACEヘッド)の91 / 5.6 / 1.0、オリジナルACEの70 / 11.0 / 1.8に対して優位である — つまりDINOv2特徴とクエリ事前学習された回帰器の両方が寄与している。25分のマッピングでは、ACE-Gは96 / 3.7 / 0.7に達し、GLACE(93 / 3.5 / 0.6)に匹敵し、12MBの地図はMASt3R+Kapture(94 / 2.5 / 0.5、5〜10時間のマッピング)の約5GBに対して非常に小さい。
- RIO10(オブジェクト配置が変化した再スキャンシーン; 平均中央値誤差): ACE-Gは41.1cm / 13.8°であり、DINO-ACEの83.8 / 15.9、ACEの358.4 / 58.7に対して優位である — すべてのシーンで中央値誤差は1m未満に保たれるが、MASt3Rは一部のシーンで50%以上の画像のポーズ推定に失敗する。
- Cambridge Landmarks(屋外、屋内主体の事前学習に対して分布外): ACE-G(平均25.3cm / 0.4°)はDINO-ACEに対して顕著に改善するが、GLACE(13.5cm / 0.3°)には及ばず、ACEよりわずかに劣る — これは現在の事前学習カバレッジの正直な限界である。
SLAMにおける意義
SCRの系統は、展開コストを一貫して削減してきた。DSACはSCRをエンドツーエンドで学習可能にし、ACEはシーンごとの学習を数分に短縮し、ACE Zeroは既知のポーズの必要性を取り除き、ACE-Gは残っていた弱点 — シーン固有回帰器の設計上の過学習 — に取り組んでいる。汎化可能な再位置特定は、シーンごとの最適化が運用上コストが高いコンシューマAR やフリート規模のロボティクスにおいて重要である。それはまた、シーンごとの最適化を大規模事前学習済みモデルからのフィードフォワード推論に置き換えるという、レベル5全体のより広い潮流にも並行している。