MonoDepth
Godard 2016 · 論文
一行要約 — ステレオ画像の左右フォトメトリック整合性を利用して学習する自己教師あり単眼深度推定手法。学習にはステレオ画像を用いるが、テスト時には単眼画像のみで深度を推定できる。
問題
教師あり単眼深度推定は深度推定を回帰問題として扱うため、大量の正解深度データを必要とするが、動きや反射のある自然なシーンでは高価なレーザースキャナーでさえ不正確な計測しか得られない。一方でステレオリグは安価で普及している。MonoDepthの着眼点は、学習時に深度推定を画像再構成問題として定式化することである。整流化された一方のビューをもう一方に歪ませる視差場 を予測することは、深度を (基線長 、焦点距離 )で予測することと等価であるため、画像再構成誤差が学習信号となり、深度ラベルは一切不要になる。
手法とアーキテクチャ
ネットワーク。 DispNetに着想を得た全層畳み込みのエンコーダ・デコーダ(パラメータ数3100万;ResNet50エンコーダ版は4800万)で、スキップ接続を持ち、4つのスケールで視差出力を行う。重要な点として、左画像のみから視差マップ と の両方を予測する。右画像は損失計算にのみ使用される。バックワードワーピングには、空間変換ネットワーク由来の完全微分可能な双線形サンプラーを用いる:。視差はスケール付きシグモイドにより に制約される。ELUがReLU(中間スケールの視差を早期に固定してしまう)を置き換え、逆畳み込みは最近傍アップサンプル+畳み込みに置き換えられている。
損失関数。 全体損失 であり、各スケールは(左右)対をなす3つの項を組み合わせる:
- 見え方マッチング — SSIM + L1フォトメトリック再構成損失(、簡略化された ブロックフィルタSSIM):
- エッジ考慮の視差平滑化 — 視差勾配に対するL1損失で、画像エッジ部分では重みを下げることで、深度の不連続性が物体境界に一致するようにする:
- 左右視差整合性 — 本手法の核心となる新規性であり、左ビューの視差マップは右ビューを投影したものと一致しなければならない:
単純に一方向のサンプリングのみを行うと、誤った画像に整合した視差や「テクスチャコピー」アーティファクト、深度不連続点での誤差が生じる。 と の間で相互整合性を強制することで、両方の問題が解決される。重み:、各スケールで 。Adam(学習率 、バッチサイズ8)でTitan X上で約25時間、50エポック学習。フリップ・色調ジッターによるデータ拡張を実施。テスト時後処理(pp)では画像とその鏡像の視差を平均し、ステレオの遮蔽(disocclusion)によるランプ状アーティファクトを抑制する。テスト時には最も細かいスケールの のみが使用され、512×256画像に対して推論は35ms未満(28fps以上)で完了する。
実験結果
- KITTI分割(公式視差画像200枚):左右整合性はLR項なしのバリアントおよびDeep3Dの画像形成ベースラインを全指標で上回る(Ours K:Abs Rel 0.124、RMSE 6.125、D1-all 30.27 vs Deep3D 0.412/13.69/66.85);Cityscapes事前学習+KITTIで0.104/5.417に改善し、ResNet+後処理では0.097/5.093に達する。
- Eigen分割(テスト画像697枚):KITTIのみで学習した場合、Abs Rel 0.148、RMSE 5.927、 = 0.803であり、深度ラベルを一切使わずにEigenら(0.203)やLiuら(0.201)の教師あり手法を上回る;ResNet+ppを用いたCS+Kでは Abs Rel 0.114、RMSE 4.935、 = 0.861に達する。50mでキャップした場合、Gargら(Abs Rel 0.169)を上回る(0.140)。
- 汎化性能:Make3Dで一度も学習していないにもかかわらず、完全教師あり手法に対して優れた質的結果を示す;ステレオ入力バリアントはさらに良好(Abs Rel 0.068)であり、単眼の方がより難しい問題であることを裏付けている。
SLAMにおける意義
MonoDepthは自己教師あり深度推定の先駆けとなり、巨大な研究分野(Monodepth2、PackNetなど多数)を生み出した。その左右整合性とSSIM+L1フォトメトリック損失の仕組みは標準的な手法となった。SLAMにとっては、深度センサーを必要とせず、SLAMシステムがすでに収集している走行・ロボット映像と同種の生データから学習できる深度事前知識への道を開いた点が重要であり、これはD3VO、MonoRec、そして現代の単眼密な地図生成における自己教師あり深度系列の基盤となっている。
関連ノート
- SfM-Learner — 単眼動画版の対応手法(深度+自己運動)
- Self-supervised depth — コンセプト概観
- MiDaS — 複数データセットへの汎化を進めた後継手法
- MonoRec — この系譜を基にした密な再構成
- D3VO — この自己教師あり学習の考え方を基にしたディープVO