DUSt3R
Wang 2024 · 論文
一行要約 — ペアワイズ3D再構成を、フィードフォワードTransformerによる画像ペアからの密なポイントマップの直接回帰として再定義し、カメラキャリブレーション、特徴マッチング、明示的な幾何モデルを一切必要としない。
問題
実環境でのマルチビューステレオは、まずカメラの内部・外部パラメータを推定することを要求する。これは対応する画素を3Dで三角測量するために必須であるが、その取得は煩雑である。キャリブレーション、検出、マッチング、姿勢推定、三角測量という古典的パイプライン全体は、脆弱な段階の連鎖であり、どの段階でも失敗しうる。DUSt3R(「Dense and Unconstrained Stereo 3D Reconstruction」)はこの逆の立場をとる。キャリブレーションや視点姿勢に関する事前情報を何も持たずに、任意の画像コレクションを再構成する——3D構造を直接回帰することによって。
手法とアーキテクチャ
ポイントマップ表現: ネットワークは2枚のRGB画像を受け取り、2つのポイントマップ(画素ごとの3D座標)と信頼度マップを出力する。両方のポイントマップはカメラ1の座標系で表現されるため、1回の順伝播でキャリブレーション、対応付け、再構成が同時に解かれる。同じ画像を2回入力すると単眼深度が得られ、この定式化は単眼と両眼の両方の場合を統一する。
アーキテクチャ(CroCo様式、CroCoの事前学習から初期化): 重み共有のシャム型ViT-Largeエンコーダ、、。続いて、各ブロックが自己注意、もう一方のビューのトークンへの交差注意、およびMLPを実行する、2つの絡み合ったViT-Baseデコーダ:
である。各ブランチのDPT回帰ヘッドがすべてのデコーダトークンをポイントマップ+信頼度マップにマッピングする。幾何制約は一切課されない——ネットワークは幾何的に整合した学習データからこの事前分布を学習する。
学習目的: ビュー内の有効な画素それぞれについてのスケール正規化3D回帰:
ここでは原点からのすべての有効点の平均距離である。これは、予測をどこで信頼できるかを学習する信頼度重み付き損失に包まれる:
すべてが副産物として得られる: 画素マッチングは3Dポイントマップ空間における相互最近傍探索によって;焦点距離は上の画素再投影残差のWeiszfeld様式の最小化によって;相対姿勢はのProcrustes整合、またはPnP-RANSACによって;絶対姿勢(視覚的位置推定)は参照ポイントマップに対するスケーリングによって得られる。
視点に対する大域整合: 画像ペア上に連結性グラフを構築し(ネットワーク推論はH100上でペアあたり約40ms)、世界座標系のポイントマップ、エッジごとの剛体姿勢とスケールを最適化する:
バンドル調整とは異なり、これは2D再投影誤差ではなく3D投影誤差を最小化し、単純な勾配降下法(数百ステップ、GPU上でわずか数秒)によって実行される。をピンホールパラメータ化に置き換えると、すべての姿勢、内部パラメータ、深度マップが復元される。
学習データ: 8つのデータセット(Habitat、MegaDepth、ARKitScenes、Static Scenes 3D、Blended MVS、ScanNet++、CO3D-v2、Waymo)から850万ペア。まず224pxで学習し、その後さまざまなアスペクト比で512pxで学習する。
実験結果
- マルチビュー姿勢推定(シーケンスあたり10枚のランダムフレーム): CO3Dv2上で、大域整合を用いたDUSt3R-512はRRA@15 96.2 / RTA@15 86.8 / mAA(30) 76.7を記録し、PnPを用いた場合は94.3 / 88.4 / 77.2である——PoseDiffusionの80.5 / 79.8 / 66.5、PixSfMの33.7 / 32.9 / 30.1と比較される。学習時に一度も見ていないRealEstate10Kでは、mAA(30)がGAで67.7、PnPで61.2に達し、PoseDiffusionの48.0と比較される。
- 単眼およびマルチビュー深度: 同一の単一モデル(タスクごとのファインチューニングは一切なし)が、KITTI、ScanNet、ETH3D、DTU、Tanks & Templesのベンチマークにおいて、自己教師あり・教師あり比較の両設定で最先端または同等の結果を達成する。
- 視覚的位置推定: 姿勢付きの参照画像に単純にマッチングするだけで、7-ScenesとCambridge Landmarksにおいて競争力のある絶対姿勢精度を実現。
- その深い影響はパラダイムレベルのものである。十分な3Dデータで学習された単一のフィードフォワードネットワークが、キャリブレーション-検出-マッチング-三角測量のパイプラインを置き換え、「3D基盤モデル」という系譜を立ち上げた——MASt3R(マッチング)、MASt3R-SLAM(オンライン)、MonST3R(動的シーン)、そしてVGGTファミリー(マルチビューフィードフォワード)はすべてそのポイントマップ表現の上に構築されている。
SLAMにおける意義
DUSt3Rは幾何ビジョンにおける「3D基盤モデル」の時代を始めた。単一の事前学習済みネットワークが、キャリブレーションされていない画像や2視点のみに対してさえ動作しながら、古典的な検出-マッチング-三角測量のパイプラインを置き換えるというものである。これはMASt3RとMASt3R-SLAMを直接生み出し、VGGTのようなフィードフォワード型マルチビューモデルに影響を与え、今では学習されたポイントマップ回帰器がフロントエンドとなり古典的な最適化がバックエンドとなる、SLAM研究の一大分野を支えている。その前提(オフラインでのペア形成、大域整合コスト、ペアごとのスケール曖昧性)を理解することは、後続システムが何を修正しているかを説明する。