DeepTAM
Zhou 2018 · 論文
一行要約 — DeepTAM(ECCV 2018)はDTAMを学習で再構想したものである。coarse-to-fineのトラッキングネットワークが、合成されたキーフレームビューに対する姿勢の増分を推定し、マッピングネットワークは現在の推定値の周りの狭帯域で精緻化されるプレーンスイープコストボリュームからキーフレーム深度を抽出する。
問題
古典的な密トラッキング・アンド・マッピング(DTAM、LSD-SLAM)は、直接的な光度最小化と手作りの正則化項に依存しており、テクスチャの少ない領域では脆く、良い初期化を必要とする。単純な学習型の代替手法(DeepVO、SfM-Learner、UnDeepVO)は2フレーム間の運動を回帰するが、これは学習データセットの運動統計(KITTI風の平面的な3自由度運動)を引き継いでしまい、完全な6自由度トラッキングへの一般化が乏しい。DeepTAMは、キーフレームベースの密なカメラトラッキングと深度マップ推定を、実績のあるトラッキング/マッピングアーキテクチャを保持しつつ完全に学習で実現できるかを問う。
手法とアーキテクチャ
トラッキング。 現在の画像 とキーフレーム (画像+逆深度)が与えられたとき、目標は変換 であり、、すべて 上にある。これを直接回帰する代わりに、DeepTAMは現在の姿勢推定値 で仮想キーフレーム をレンダリングし、小さな増分のみを学習する:
これは「学習問題を大幅に簡素化し、カメラ運動に関するデータセットの偏りを緩和する」。3つのエンコーダ・デコーダネットワークが 、、 でcoarse-to-fineに実行され、それぞれ新たにレンダリングされた仮想キーフレームに対する増分 を予測し、最終的な姿勢はすべての増分の積となる。補助的なオプティカルフロー分岐(学習中のみ有効)は、エンコーダに運動特徴を学習させる役割を持つ。単一の姿勢の代わりに、重み共有された 個の全結合分岐が仮説 (角軸表現の回転+並進)を出力し、次のように平均される:
損失 は、フローの端点誤差、重み付き姿勢誤差 、そして仮説のばらつき(サンプルから推定される共分散 )に対する多変量ラプラス分布の負の対数尤度を組み合わせたものであり、これによりネットワークは異なる仮説を予測するよう促される。仮想キーフレームはデータ拡張としても機能する。真値の周りで をサンプリングすることで、偏った学習データ(SUN3D、SUNCG)にもかかわらず、すべての6自由度運動をシミュレートできる。
マッピング。 キーフレームごとの深度はプレーンスイープコストボリュームから得られる。ピクセル と深度ラベル について、光整合性は フレームにわたって累積される:
ここで はキーフレームとワープされた画像との間の パッチのSAD(絶対差分和)であり、 はコスト曲線が明確な一意の最小値 を持つ場合に1に近くなるマッチング信頼度の重みである。固定帯域モジュール(深度範囲全体に均等に配置された32個のラベル、入力は +コストボリューム)は補間係数 を回帰し、 を与える――これはスケールに依存しない出力であり、一般化を助ける。次に狭帯域モジュールが反復する:前の推定値を中心としたピクセルごとのラベル (帯域幅 )でコストボリュームを再構築する。1つのエンコーダ・デコーダはこれを学習されたコストボリュームに変換し、微分可能なソフトargminで読み出す。2つ目のエンコーダ・デコーダはその結果を正則化する――このペアは変分法におけるデータ項と平滑化項を交互に適用するのと同様に振る舞う。
実験結果
- トラッキング(TUM RGB-Dベンチマーク、並進RMSE、m/s): 平均0.040、対してKerl et al.のRGB-D SLAMのフレーム対キーフレームオドメトリは0.060――キーフレームにのみデータセットの深度を用いているにもかかわらずである。アブレーション:フロータスクなしで0.050、複数仮説なしで0.043。ベンチマークでの学習やファインチューニングは行っていない。
- トラッキング+マッピング: fr1系列全体で平均0.086、対してCNN-SLAM(ポーズグラフ最適化なしで実行)は0.253。
- マッピング(10フレーム系列、MVS/SUNCG/SUN3Dのテスト分割): すべての指標・データセットで最良――例えばMVSでL1-inv 0.036(対DTAM 0.086、DeMoN 0.059);SUNCGでsc-inv 0.128(対SGM 0.248、DTAM 0.343、DeMoN 0.383)。フレーム数が多いほど有利(MVSのL1-invは2フレームで0.117、10フレームで0.083)であり、狭帯域反復はおよそ3回で収束する(1反復で0.076、3反復で0.065)。
- 頑健性: 姿勢ノイズが増加する(標準偏差が最大 まで)条件下で、SGMとDTAMは急速に劣化するが、DeepTAMはシーン構造を保持する;ファインチューニングなしでのKITTIへの定性的な一般化も確認された。
SLAMにおける意義
DeepTAMは、古典的な密トラッキング・アンド・マッピングのアーキテクチャが深層学習への移行に耐えることを示した。構造(キーフレーム、コストボリューム、増分的アラインメント)を保持し、古典的手法が苦手とするコンポーネント(ロバストなアラインメント、深度の正則化)を学習するというアプローチである。その増分的アラインメントの考え方は、RAFTやDROID-SLAMの反復更新オペレータを先取りしており、DTAM時代の密SLAMと今日の学習型システムとをつなぐ重要な概念的リンクとなっている。