Depth from Videos in the Wild

Gordon 2019 · 論文

一行要約 — この研究(ICCV 2019)は、深度、エゴモーション、物体モーションと共にカメラ内部パラメータ(レンズ歪みを含む)を学習することで、自己教師あり深度学習を真に制約のないビデオへと押し進め、未知のカメラでの任意のビデオでの学習を可能にした。

問題

SfM-Learnerの系譜にある自己教師あり深度手法は、1つのフレームを別のフレームにワープして光度誤差にペナルティを課すことで生のビデオから学習する——しかしそれらはカメラ内部パラメータが既知であることを仮定しており、学習をKITTIのようなキャリブレーション済みデータセットに限定してしまう。またシーンに独立に動く物体やオクルージョンが含まれると性能が劣化する。目標が世界中のビデオ(任意のカメラ、任意のコンテンツ)から幾何を学習することであるなら、キャリブレーションと静的シーンの仮定の両方を取り除く必要がある。

手法とアーキテクチャ

2つの畳み込みネットワークが、フレーム間の一貫性のみを教師信号として同時に学習される:単一画像から深度を予測する深度ネットワーク(ResNet-18ベースのUNet、ロジットを深度にマッピングするsoftplus活性化z=log(1+e)z=\log(1+\mathrm{e}^{\ell}))と、2枚のフレームからカメラ回転r0r_0、大域的並進t0t_0、画素ごとの残差並進場、そしてカメラ内部パラメータを予測するモーションネットワーク(FlowNetに触発されたUNet)——各内部パラメータはボトルネックから独自の1x1畳み込みによって出力される。隣接フレーム間のバックボーンワープは

zp=KRK1zp+Kt,z^{\prime}p^{\prime}=KRK^{-1}zp+Kt,

ここでKKは内部パラメータ行列、p,pp,p^{\prime}は同次画素座標、z,zz,z^{\prime}は深度、R,tR,tはモーションである。

なぜ内部パラメータが学習可能か。 損失はKKに、KtKtKRK1KRK^{-1}を通じてのみ依存する;並進はシグナルを与えない(誤ったK~\tilde{K}に対してt~=K~1Kt\tilde{t}=\tilde{K}^{-1}Ktとすれば損失は変わらない)が、回転はシグナルを与える——どのK~,R~\tilde{K},\tilde{R}KRK1KRK^{-1}を再現できない。論文はフレーム間の回転から焦点距離の許容誤差を導出する:

δfx<2fx2w2ry;δfy<2fy2h2rx,\delta f_{x}<\frac{2f_{x}^{2}}{w^{2}r_{y}};\quad\delta f_{y}<\frac{2f_{y}^{2}}{h^{2}r_{x}},

ここでrx,ryr_x,r_yは回転角度(ラジアン)、w,hw,hは画像サイズである——回転が大きいほど焦点距離がより厳密に固定される。

物体モーション。 RRは画像全体で一定に保たれる;ttは粗い「動く可能性がある」マスクmmの内部でのみ一定値から逸脱してよい(検出バウンディングボックスの和集合で十分——インスタンスセグメンテーションやトラッキングは不要):

t(x,y)=t0+m(x,y)δt(x,y).t(x,y)=t_{0}+m(x,y)\,\delta t(x,y).

オクルージョンを考慮した損失。 各ソース画素はその予測深度で逆投影され、モーション場によって移動し、再投影される;ある画素が(L1光度+深度+モーションのサイクル一貫性)損失に入るのは、変換後の深度がzi,jzi,jtz^{\prime}_{i^{\prime},j^{\prime}}\leq z^{t}_{i^{\prime},j^{\prime}}を満たす場合、つまり目標深度マップの手前に位置する場合のみである——両方向に対称的に適用される。SSIMは深度の食い違いが大きい場所では重みが下げられる。ランダム化レイヤー正規化——平均と分散に乗法的なガウスノイズを加えたレイヤー正規化——が、異常な挙動(バッチサイズと共に精度が劣化する)を示していたバッチ正規化に置き換わる。

実験結果

SLAMにおける意義

この論文は、無制限のビデオから幾何を学習する上での最後の実用的な障壁——キャリブレーション——を取り除いた。カメラパラメータを単に別の学習可能な出力として扱うという発想は、学習型カメラモデル(Neural Ray Surfaces)に再登場し、今日のキャリブレーション不要なフィードフォワード再構成(DUSt3R系モデルが内部パラメータを与えられずに幾何を予測する)とも響き合う。SLAM実践者にとっては、光度自己教師あり学習の内部で動的物体とオクルージョンを扱うための参照点でもある——これは直接法の根強い失敗モードである。

関連ノート