MonST3R
Zhang 2024 · 論文
一行要約 — DUSt3R型のポイントマップ推定を動的シーンに拡張し、タイムステップごとにポイントマップを予測することで、動く物体を含む動画からのビデオ深度、カメラ姿勢、4D再構成を可能にした。
問題
動的シーンからの幾何推定は、従来、問題を部分タスク(深度、フロー、動き分割)に分解する多段階パイプラインや大域最適化に依存しており、「エラーを起こしやすい複雑なシステムにつながる」。DUSt3Rのポイントマップ表現は静的な再構成を単一のフィードフォワード予測へと統合したが、シーンが剛体であることを前提としている。動く物体を含む動画を入力すると、動いている内容を1つの矛盾した静的再構成に押し込んでしまう(あるいは、正解の動きマスクを与えたとしても、カメラ姿勢を信頼できる形で推定できない)。MonST3R(Motion DUSt3R)は、明示的な動きモデルを追加せずにポイントマップの発想を動きの中で生かせるかを問う。
手法とアーキテクチャ
タイムステップごとのポイントマップ。 フレーム対に対し、ネットワークはポイントマップと(信頼度付き)を予測し、両方をフレームのカメラ座標系で表現する——これはDUSt3Rの設定そのものだが、各ポイントマップが今度はある一つの時点に対応するようになっている点が異なり、動いている内容はその瞬間の位置で表現される。
動きに対するファインチューニング。 障害はデータである。深度付きの動的でポーズ既知の動画が必要になる。著者らはPointOdyssey(サンプリング重み50%)、TartanAir(25%)、Waymo(20%)、Spring(5%)という4つのデータセットを組み合わせ、ViT-Baseデコーダーと DPTヘッドのみをファインチューニングする(CroCoの幾何特徴を保つためエンコーダーは凍結)。フレーム対は時間ストライド1〜9でサンプリングされ(ストライドが大きいほど確率が増す)、視野角の拡張、DUSt3Rの信頼度考慮回帰損失を用いる。25エポック×2万ペア、RTX 6000×2基で1日。
下流ツール。 内部パラメータはDUSt3Rに従う(フレームごとに焦点距離を解く)。相対姿勢は、動的物体に汚染された2D-2D対応を避けるため、1つのビュー内でのピクセルごとの2D-3D対応をPnP+RANSACで用いる。
信頼できる静的マスクは、カメラ運動のみによって生じるフローを推定オプティカルフローと比較する: 。
動的大域点群+姿勢。 DUSt3Rの全対グラフの代わりに、対はスライディング時間窓内で(ストライドサンプリングにより)形成される。大域ポイントマップは、、フレームごとの深度で再パラメータ化され、次式で最適化される。
ここではDUSt3Rの整合項、は軌跡を平滑化し、は信頼できる静的領域内で再投影された大域幾何を推定フローに一致させる(; Adamで300反復)。を直接返すことで時間的に一貫したビデオ深度が得られる。推論: 60フレームの動画(窓9、ストライド2)のペアワイズポイントマップに約30秒、加えてRTX 6000上で約1分の最適化。
実験結果
- ビデオ深度(スケール&シフト整合、Abs Rel / δ<1.25): Sintel 0.335/58.5、Bonn 0.063/96.4、KITTI 0.104/89.5——BonnとKITTIで同時期の専用手法DepthCrafter(0.075/97.1、0.110/88.1)、およびすべての深度・姿勢同時推定ベースライン(CasualSAM: Abs Rel 0.387、0.169、0.246)を上回る。スケールのみの整合では差がさらに広がる(0.345/0.065/0.106 対 DepthCrafterの0.692/0.217/0.141)。
- カメラ姿勢(ATE): Sintel 0.108、ScanNet 0.068——深度+姿勢同時推定手法の中で最良(CasualSAM 0.141/0.158; DUSt3Rは正解の動きマスクを与えてさえ0.417/0.081)であり、正解の内部パラメータを必要とする姿勢専用トラッカー(LEAP-VO、Sintel 0.089)とも競合的; TUM-dynamics ATE 0.074。
- 単一フレーム深度はファインチューニング後もDUSt3R水準を維持(Sintel 0.345 対 0.424、Bonn 0.076 対 0.141、KITTI 0.101 対 0.112 Abs Rel; 静的なNYU-v2ではわずかに悪化、0.091 対 0.080)。
- アブレーション: すべての訓練データセットが寄与する; デコーダー+ヘッドのファインチューニングは代替案より優れる; 平滑化・フロー損失は深度への影響を最小限に抑えつつ姿勢を改善する。定性的には、DAVIS上でのフィードフォワード4D再構成は、DUSt3Rの剛体整合が破綻する場面でも成功する。
SLAMにおける意義
動的環境は幾何ベースSLAMの常態的な失敗モードであり、従来は動く物体をマスクして除外することで対処されてきた(DynaSLAM、DS-SLAM)。MonST3Rは別の道を示す。動きが存在する中でネイティブに幾何を推定する基盤モデルであり、そこから姿勢・ビデオ深度・動き分割のすべてが1つの表現から自然に得られる——そして、明示的な動きモデルを一切用いず、控えめで的確に選ばれたファインチューニング(主に合成データ、凍結エンコーダー)だけで十分であることを示している。これは静的なDUSt3R/MASt3R系列から4Dシーン理解への鍵となる足がかりであり、静止世界という前提はパイプラインレベルで後付けするのではなく、表現レベルで解消できることを示唆している。