VGGT-SLAM

Maggio 2025 · 論文

一行要約 — VGGTをフロントエンドとして使う密なモノキュラーRGB SLAM。フィードフォワードのサブマップ再構成を、SL(4)多様体上で最適化されたファクターグラフで逐次的にアライメントする——未キャリブレーションのサブマップは、単なる相似変換ではなく完全な15自由度の射影変換だけ異なりうるためである。

問題

VGGTは1回のフォワードパスでフレームのバッチを再構成するが、GPUメモリはRTX 4090(24 GB)上で1回の推論を約60フレームに制限するため、長い動画はサブマップに分割し、その後1つのマップに統合する必要がある。関連研究はサブマップを相似変換(回転+並行移動+スケール)でアライメントするが、VGGT-SLAMはこれが未キャリブレーションカメラには不十分であることを示す。射影復元定理(Projective Reconstruction Theorem)により、カメラ運動、シーン構造、内部パラメータについて何の仮定もない場合、シーンは真の幾何の15自由度射影変換までしか復元できない。したがって7自由度のSim(3)アライメントでは、特にフレーム間の視差が小さくVGGTの学習されたメトリック事前情報が信頼できなくなる場合、2つのサブマップを常に一致させることはできず、サブマップ間にせん断、伸縮、パースペクティブ歪みが残ってしまう。

手法とアーキテクチャ

実験結果

RTX 4090上で5回の実行を平均し、7-ScenesとTUM RGB-D(evoによるATE RMSE)で評価。パラメータはwloop=1w_{\text{loop}}=1τdisparity=25\tau_{\text{disparity}}=25 px、τconf=25%\tau_{\text{conf}}=25\%、RANSAC反復300回。

SLAMにおける意義

VGGT-SLAMは、多視点フィードフォワード基盤モデルを適切なSLAMループ——サブマップ、ループ閉じ込み、そしてこのようなモデルが未解決のまま残す再構成曖昧性への原理的な対処——に組み込んだ最初のシステムである。未キャリブレーションのフィードフォワードサブマップはSim(3)ではなくSL(4)でアライメントされなければならないという中心的な観察は、学習された幾何の上にSLAMを構築する人々にとって概念的に重要であり、そのSL(4)ファクターグラフソルバーはその後GTSAMにマージされた。DROID-SLAMとMASt3R-SLAMから、ますます学習ベース化するSLAMスタックへの直接的な系譜上に位置する。

関連ノート