自己教師あり深度推定

自己教師あり単眼デプス推定は、グラウンドトゥルースのデプスラベルを一切使わずに、単一画像からピクセル単位のデプスを予測するネットワークを訓練する手法である。教師信号は**測光的整合性(photometric consistency)**であり、予測されたデプス(および相対カメラ姿勢)が正しければ、シーンのある視点は別の視点にワープでき、ワープされた画像は実際の画像と一致するはずだという考えに基づく。

具体的には、ターゲット画像ItI_tとソース画像IsI_s(ステレオペアの他方の画像、または隣接するビデオフレーム)が与えられたとき、予測されたデプスDtD_tと相対姿勢TtsT_{t \to s}はワープを定義する。各ピクセルp\mathbf{p}は3Dへ逆投影され、変換され、ソースビューに再投影される。

psKTtsDt(p)K1p,\mathbf{p}_s \sim K\, T_{t \to s}\, D_t(\mathbf{p})\, K^{-1} \mathbf{p},

訓練損失はIt(p)I_t(\mathbf{p})と再構成されたIs(ps)I_s(\mathbf{p}_s)の間の測光的な差を罰する(典型的にはSSIM + L1の混合と、エッジを考慮した平滑性事前情報を組み合わせる)。訓練体制は2種類存在する。

Monodepth2(Godard 2019)は代表的なリファレンス実装であり、主要な失敗モードに対する簡潔な修正を提供する。ソースフレーム間での画素ごとの最小再投影損失(オクルージョンに対処)、フレーム間で変化しないピクセルを無視するオートマスキングのトリック(カメラと一緒に動く物体や静止フレームに対処)、そして完全解像度で計算されるマルチスケール損失である。

損失関数の全体

標準的な測光誤差は構造的類似性と絶対誤差を組み合わせる。

pe(Ia,Ib)=α2(1SSIM(Ia,Ib))+(1α)IaIb1,α=0.85,pe(I_a, I_b) = \frac{\alpha}{2}\left(1 - \mathrm{SSIM}(I_a, I_b)\right) + (1 - \alpha)\,\| I_a - I_b \|_1, \qquad \alpha = 0.85,

ここでSSIM項は、生のL1損失を支配してしまうであろう輝度/露出の変化に対するロバスト性をもたらす。テクスチャの少ない領域では測光誤差が無情報であるため(平坦な壁はどのデプスでも同様に再現される)、エッジを考慮した平滑性項が(平均正規化された)逆デプスdd^*を正則化する。

Lsmooth=xdexI+ydeyI,L_{smooth} = \left| \partial_x d^* \right| e^{-\left|\partial_x I\right|} + \left| \partial_y d^* \right| e^{-\left|\partial_y I\right|},

これは、デプスの不連続がありそうな画像エッジを除いて滑らかなデプスを促す。Monodepth2の、ソースフレームにわたる画素ごとの最小値minspe(It,Ist)\min_s pe(I_t, I_{s \to t})は、通常の平均を置き換えるものである。ある視点でオクルードされ別の視点で可視なピクセルは、再投影が実際に成功する視点に対してのみ評価される——平均を最小に変えるという2文字の変更が、絶大な効果をもたらす。

ワーピングが要求するものに注意したい。非整数座標ps\mathbf{p}_sにおけるIsI_sの微分可能な双線形サンプリング(spatial-transformerのトリック)である。これが、デプス、姿勢、投影という幾何学的パイプライン全体を勾配降下法によってエンドツーエンドで訓練できるようにしている部分である。

失敗する場所、そしてその理由

この教師信号は、その前提が成り立つ範囲でのみ有効である。すなわち静的でランバート的なシーン、輝度不変性、そして移動するカメラである。前提が破られるたびに、既知の失敗モードが生じる。

よくある落とし穴

SLAMでの利用

SLAMにおいて、これらのネットワークはデプス事前情報として機能する。CNN-SLAMは学習されたデプスをLSD-SLAM風の密なマッピングに融合する。DVSOはステレオで訓練されたネットワークをDSO内部の「仮想ステレオ」制約として用い、単眼のスケール不定性を解決する。D3VOはさらに進んで姿勢と測光的不確実性も学習し、この3つをVOバックエンドに緊密に統合する。

SLAMにおける意義

自己教師あり深度推定は、ラベル付けされていないビデオだけを訓練に用いて、単一カメラを近似的なデプスセンサーへと変える——単眼SLAMの2つの古典的な弱点、スケール不定性と遅いデプス初期化に直接立ち向かうものである。その中核にある測光ワーピング損失は、直接法SLAMの測光誤差と同じ仕組みであり、これが深層学習と直接法を結ぶ自然な橋渡しとなっており、今日のデプス基盤モデルの概念的な祖先でもある。

関連ノート