DeMoN

Ummenhofer 2017 · 論文

一行要約 — DeMoN(CVPR 2017)は2視点構造復元運動(SfM)を学習問題として定式化した。スタックされたエンコーダ・デコーダネットワークの連鎖が、制約のない画像ペアから深度とカメラモーションを同時に推定し、強制的なオプティカルフロー予測を通じて対応関係を学習する。

問題

古典的な2視点SfMは、特徴点検出、記述子マッチング、essential行列推定、密なステレオを連鎖させる——モーションはまず疎で外れ値の多い対応関係から推定されるため、モーション推定が悪ければ深度が汚染され、テクスチャの少ない領域は失敗し、既存の全パイプラインは小さなカメラ並進で破綻する。単一画像の深度ネットワークはマッチングを回避するが、外観の事前分布のみに依存するため学習データの分布外での汎化性能が低い。DeMoNは連続する制約のない画像ペアから深度とモーションを計算するネットワークをエンドツーエンドで学習し——素朴なアプローチが失敗することを示す。すなわち2フレームを入力する単純なエンコーダ・デコーダは単一画像のショートカットを取ってしまい、2枚目の画像を単に無視する。

手法とアーキテクチャ

gh[f]=(f(i+h,j)f(i,j)f(i+h,j)+f(i,j), f(i,j+h)f(i,j)f(i,j+h)+f(i,j)),\mathbf{g}_{h}[f]=\left(\tfrac{f(i+h,j)-f(i,j)}{|f(i+h,j)|+|f(i,j)|},\ \tfrac{f(i,j+h)-f(i,j)}{|f(i,j+h)|+|f(i,j)|}\right)^{\top},

Lgradξ=h{1,2,4,8,16}i,j gh[ξ]gh[ξ^] 2,\mathcal{L}_{\text{grad}\,\xi}=\sum_{h\in\{1,2,4,8,16\}}\sum_{i,j}\left\|\ \mathbf{g}_{h}[\xi]-\mathbf{g}_{h}[\hat{\xi}]\ \right\|_{2},

これは5つの間隔にわたって近傍間の相対深度誤差にペナルティを課す——深度の不連続部を鋭くし、均一な領域を滑らかにする。

実験結果

SLAMにおける意義

DeMoNは「2枚の画像をネットワークに入力すると幾何が出てくる」系譜の祖先である。学習された2視点幾何には認識だけでなくマッチングが必要であることを示した——このレッスンは今もフロントエンド設計を形作っている——そしてその学習型反復リファインメントはBA-Net、DeepV2D、RAFT系システムを先取りしており、その制約のない2視点設定こそまさにDUSt3Rが基盤モデルのスケールで再訪するものである。

関連ノート