MAC-VO
Qiu 2024 · 論文
一行要約 — メトリックスケールを意識したマッチング共分散を予測し、それをキーポイント選択と姿勢最適化における残差重み付けの両方に利用する、学習ベースのステレオ視覚オドメトリ。
問題
学習ベースのVOモデルは信頼性の推定が苦手である。教師なしで学習される信頼度重み(DROID-SLAM、DPVO)はスケールに依存しないものであり、マッチ同士を相対的にランク付けするだけでメートル単位での実際の3D推定誤差を反映しない。これにより「スケールが異なる環境間で共分散が一貫しなくなり」、「異なるモダリティやセンサーからの複数の制約を統合することがより難しくなる」。一方でキーポイント選択は依然としてテクスチャの豊富なエッジやコーナーを好むが、そこはまさに補間やエッジの曖昧さのために学習によるマッチングと深度が最も不正確になる場所である — D3VOはそのような特徴点がランダム選択よりも悪い性能になり得ることを示した。MAC-VOはこの両方を、単一の学習済みでメトリックスケールを意識した不確実性モデルに置き換える。
手法とアーキテクチャ
不確実性を考慮したマッチングネットワーク。 FlowFormerバックボーンを共有するネットワークが、フレーム間の深度、オプティカルフロー 、およびそれらの不確実性 を同時に推定する。共分散デコーダは再帰的なフローデコーダに相乗りし、対数空間での反復更新 を予測する(加算的な更新、正の分散が保証され、勾配が安定する)。教師信号は更新反復にわたる負の対数尤度損失である。
ここで は正解フロー、 は指数的に減衰する重み(比率0.8)である。TartanAirのみで学習され、それ以外の場所ではゼロショットで評価される。
不確実性に基づくキーポイント選択。 3つの重ねられたフィルタからなる。空間的な分散のための非最小値抑制、画像の境界や無効な深度を除去する幾何フィルタ、そして深度またはフローの不確実性がフレーム中央値の1.5倍を超えるピクセルを除去する不確実性フィルタである — これは動く車両、遮蔽、反射、テクスチャのない領域を暗黙的に除去する。
メトリックスケールを意識した3D共分散。 2Dの不確実性はピンホールモデルを通じて各キーポイントの完全な3D共分散へ伝播される。対角項は次のとおり(について、は対称、)。
3つの座標すべてが深度 を共有するため、このモデルは非対角項も保持する。例えば および であり、これはDROID-SLAMのスケール不変な対角行列とは異なり、メートル単位の非等方的で相関のある共分散である。深度の不確実性はさらにシーンの幾何に応じて補正される。マッチ周辺の32ピクセルのパッチ内で、 という分散が、 から構築された2Dガウスカーネル で重み付けされる — つまり深度の不連続点付近のマッチは大きな深度不確実性を継承する。
姿勢グラフ最適化。 カメラ姿勢 はTartanVOの動き推定によって初期化され、マッチした3Dキーポイントの2フレーム間レジストレーションによって伝播された共分散で重み付けして精緻化される。
PyPose上でLevenberg-Marquardt法によって解かれる。注目すべきは、複数フレームにわたるバンドル調整やループ閉じ込みが一切ないことであり、精度はすべて校正された重み付けから得られている。
実験結果
すべてのデータセットで同一の設定と重みを使用する。評価にはフレームごとの相対誤差 (m/フレーム)と (deg/フレーム)を用いる。
- EuRoC: 平均 はDROID-SLAM(完全なSLAMシステム)と同程度であり、 はすべてのベースラインより約10%良好。
- TartanAir v2(屋内外の遷移と低照度を含む新しいHard分割): DROID-SLAMより が61.9%低い。月面のようなH00シーケンスでは が82.4%低く、すべてのベースラインの中で最良の を記録。ORB-SLAM3とMASt3R-SLAMはHardシーケンスすべてで追跡を失う。
- KITTI: 他のVO手法より が53.3%低く、ORB-SLAM3(ループ閉じ込みを備えた完全なSLAMシステム)にのみ劣る順位。 は複数フレーム最適化の欠如により低下する。
- アブレーション(TartanAir v2 Hard、/): 完全なモデル .0141/.1429、対角のみの共分散 .0461/.3023、スケール不変 .0204/.2321、単位行列共分散 .0679/.3776 — メトリックスケールと非対角項の両方が重要であることを示す。
- コスト: GPUメモリ4.20 GB(DROID-SLAMより6.7倍少ない)。生の状態で2.15 fps、高速モード(bf16、更新反復4回)で10.5 fps、3090 Ti上で完全な精度の約70%を達成。
SLAMにおける意義
MAC-VOは学習ベースのオドメトリの成熟を象徴している。単に姿勢やフローを予測するだけでなく、その予測がどれだけ誤っているかを、古典的な推定理論が扱い方を知っている形式(メトリックで相関のある共分散)で予測するのである。校正された不確実性こそが、学習によるフロントエンドをフィルタ、ファクターグラフ、マルチセンサーシステムと融合するために必要なものであり — 著者が述べる次のステップでもある — この不確実性マップは下流の意思決定のための信頼性信号としても機能する。
関連ノート
- DPVO
- TartanVO
- DROID-SLAM
- D3VO
- FlowFormer — マッチングのバックボーン
- Consistency