SfM-Learner

Zhou 2017 · 論文

一行要約 — ラベルのない単眼ビデオから、単視点深度ネットワークと多視点姿勢ネットワークを、光度視点合成のみを教師信号として同時に学習し、自己教師付き深度+自己運動分野の礎を築いた。

問題

教師付きの深度・姿勢推定は高価なグラウンドトゥルースを必要とする——深度にはLiDARスキャン、姿勢にはモーションキャプチャや高精度なGPS/INSが必要——そのため学習データは計装された数個のデータセットに限定される。一方で構造化されていない単眼ビデオは基本的に無料で無限にある。

その洞察は「視点合成システムは、シーン幾何とカメラ姿勢の中間予測が物理的な真値と一致しているときにのみ一貫して良好な性能を発揮する」というものである。そのため、視点合成というメタタスクでネットワークを学習させれば、深度と自己運動が中間予測として自然に出現するはずである。

手法とアーキテクチャ

Lvs=spIt(p)I^s(p),\mathcal{L}_{vs}=\sum_{s}\sum_{p}\left|I_{t}(p)-\hat{I}_{s}(p)\right|,

ここでI^s\hat{I}_{s}は対象フレームへワープされたIsI_sである。各対象画素ptp_tは次式によってソース視点に投影される。

psKT^tsD^t(pt)K1pt,p_{s}\sim K\hat{T}_{t\rightarrow s}\hat{D}_{t}(p_{t})K^{-1}p_{t},

KKはカメラ内部パラメータ、D^t\hat{D}_tは予測された深度)そしてI^s(pt)\hat{I}_s(p_t)は4画素の近傍の微分可能な双線形サンプリング(空間変換器ネットワーク)で埋められる。正しい深度姿勢のみがワープを光度的に整合させる。

Lfinal=lLvsl+λsLsmoothl+λesLreg(E^sl).\mathcal{L}_{final}=\sum_{l}\mathcal{L}_{vs}^{l}+\lambda_{s}\mathcal{L}_{smooth}^{l}+\lambda_{e}\sum_{s}\mathcal{L}_{reg}(\hat{E}_{s}^{l}).

実験結果

SLAMにおける意義

SfM-Learnerは、古典的なSfM/SLAMの目的関数である視点間の光度整合性が、実行時のコストではなく学習信号として機能できることを示し、ネットワークが生のビデオから深度と自己運動を学習できるようにした。その視点合成損失は、Monodepth2、D3VO、そして現在SLAMパイプラインに学習された深度事前分布を戻す何十もの自己教師付きVO/深度システムのテンプレートとなった。それはdirect SLAMとend-to-endの学習型オドメトリの間の概念的な橋渡しを示すものである。

関連ノート