SfM-Learner
Zhou 2017 · 論文
一行要約 — ラベルのない単眼ビデオから、単視点深度ネットワークと多視点姿勢ネットワークを、光度視点合成のみを教師信号として同時に学習し、自己教師付き深度+自己運動分野の礎を築いた。
問題
教師付きの深度・姿勢推定は高価なグラウンドトゥルースを必要とする——深度にはLiDARスキャン、姿勢にはモーションキャプチャや高精度なGPS/INSが必要——そのため学習データは計装された数個のデータセットに限定される。一方で構造化されていない単眼ビデオは基本的に無料で無限にある。
その洞察は「視点合成システムは、シーン幾何とカメラ姿勢の中間予測が物理的な真値と一致しているときにのみ一貫して良好な性能を発揮する」というものである。そのため、視点合成というメタタスクでネットワークを学習させれば、深度と自己運動が中間予測として自然に出現するはずである。
手法とアーキテクチャ
- 損失によってのみ結合された2つのネットワーク。 深度ネットワーク(スキップ接続と多スケールサイド予測を持つDispNet風のエンコーダ・デコーダ; 深度出力は、)は単一の対象フレームを見る。姿勢ネットワーク(対象フレームとソースフレームを連結; ストライド2の畳み込み7層、その後チャンネルの1×1畳み込み——ソース視点ごとにオイラー角3つ+3次元並進——とグローバル平均プーリング)は相対姿勢を予測する。両者は同時に学習されるが、テスト時には独立に動作する。
- 視点合成の目的関数。 対象とソースを用いて次のように書ける。
ここでは対象フレームへワープされたである。各対象画素は次式によってソース視点に投影される。
(はカメラ内部パラメータ、は予測された深度)そしては4画素の近傍の微分可能な双線形サンプリング(空間変換器ネットワーク)で埋められる。正しい深度と姿勢のみがワープを光度的に整合させる。
- 説明可能性マスク。 3番目のヘッド(姿勢エンコーダを共有し、5層のデコンボリューション、ペアごとのソフトマックス)が損失を重み付けするソフトマスクを予測する: 。これは移動する物体、オクルージョン、非ランバート効果を割り引く; 1に向かう交差エントロピー正則化項が自明な全ゼロマスクを防ぐ。
- 勾配局所性の修正。 双線形サンプリングの勾配は局所的であるため、目的関数全体は画像ピラミッドにわたって適用され、平滑化のために深度の二次勾配に対するペナルティが加えられる。
- 学習。 TensorFlow; 、; Adam(学習率0.0002、バッチサイズ4)、約15万イテレーション; 128×416の3フレームスニペット(44,540個のKITTIシーケンス: 学習40,109 / 検証4,431)。
実験結果
- KITTI深度(Eigen分割、697枚のテスト画像、median-scaled): KITTIで学習したAbs Relは0.208、Cityscapes事前学習ありで0.198——深度教師付きのEigenら(Fine: 0.203)に匹敵し、姿勢教師付きのGarrgら(50m上限: 0.201対0.169)にも近い。同時期のステレオ学習によるGodardらの結果(0.148)には及ばない。ラベルがゼロであることを考えると注目に値する。
- 説明可能性のアブレーションはわずかな効果である(0.221→0.208 Abs Rel)——KITTIの3フレームスニペットはほとんど静的である。
- 姿勢(KITTIオドメトリ09/10、5フレームスニペットにわたるATE): 0.021±0.017 / 0.020±0.015 m——同じ5フレームスニペットで実行したORB-SLAM(short)(0.064±0.141 / 0.064±0.130)や平均オドメトリベースラインより優れており、ループクロージャと再位置決めを伴う全シーケンスを使うORB-SLAM(full)(0.014±0.008 / 0.012±0.011)にのみ劣る。
- Make3Dゼロショット: Make3Dの学習を一切行わずにAbs Rel 0.383——大まかなレイアウトを捉えているが、Make3D教師付き手法とのギャップがある。
- 論文が明示する継承された限界: スケールの曖昧性が残る、内部パラメータが既知でなければならない、静的シーンと光度整合性の仮定が精度を制限する——これらはdirect SLAMを制限する仮定と同じである。
SLAMにおける意義
SfM-Learnerは、古典的なSfM/SLAMの目的関数である視点間の光度整合性が、実行時のコストではなく学習信号として機能できることを示し、ネットワークが生のビデオから深度と自己運動を学習できるようにした。その視点合成損失は、Monodepth2、D3VO、そして現在SLAMパイプラインに学習された深度事前分布を戻す何十もの自己教師付きVO/深度システムのテンプレートとなった。それはdirect SLAMとend-to-endの学習型オドメトリの間の概念的な橋渡しを示すものである。