VGGT-SLAM 2.0

Maggio 2026 · 論文

一行要約 — VGGT-SLAMの後継システム。15自由度のドリフトと平面退化を除去するキーフレーム単位のファクターグラフ、VGGTのアテンション層から読み出す学習不要のループ閉じ込み検証、そしてJetson Thor上でのリアルタイム動作を実現する。

問題

VGGT-SLAMは、SL(4)上で15自由度のホモグラフィを最適化することで、未キャリブレーションのサブマップアライメント問題を解決したが、この解決策には独自のコストが伴う。高次元アライメントは、ループ閉じ込み間で急速なドリフトを引き起こし、シーンを大きく歪めることがある。また、完全なホモグラフィを解くことは、平面的なシーン(カメラが壁や床に向いている場合)では退化し、発散を引き起こす。そのファクターグラフはサブマップ単位のホモグラフィのみを推定していたため、VGGTからのキーフレーム単位の回転/並行移動誤差は最適とは言えない形で処理されていた。さらに、ループ閉じ込みのための画像検索は、外部ネットワーク(SALAD)を検証なしに信頼していた。VGGT-SLAM 2.0は、未知の内部パラメータ下でのVGGTの再構成曖昧性を尊重しつつ、これらの失敗モードを除去するようバックエンドを再設計し——さらにシステム全体をロボット上でオンラインに動作させる。

手法とアーキテクチャ

実験結果

全実験で一定のパラメータ(最小視差50px、信頼度閾値25%、SALAD 0.95、αmatch\alpha_{match} 0.85)。

SLAMにおける意義

基盤モデルSLAMの第一波(MASt3R-SLAM、VGGT-SLAM)はコンセプトを実証したが、オフラインまたはセンサレート未満で動作していた。VGGT-SLAM 2.0は残されたギャップ——組み込みロボットハードウェア上でオンラインに動作する密なフィードフォワード再構成——を埋める。これはロボティクスとARにおける実際の要件である。そのアテンション層の解析も注目に値するパターンである。凍結された基盤モデルから、学習を一切行わずにループ閉じ込み検証を抽出できることは、これらのモデルが既にどれだけ潜在的なSLAM機構を含んでいるかを示唆している。何も学習されていないため、より高速あるいはより優れたVGGTの変種を直接差し替えることができる。

関連ノート