TANDEM

Koestler 2021 · 論文

一行要約 — DSO風のフォトメトリックバンドル調整と、学習済みマルチビューステレオネットワーク(CVA-MVSNet)およびTSDF融合を組み合わせたリアルタイム単眼稠密SLAMであり、グローバルモデルからレンダリングされた深度に対して新しいフレームを追跡する。

問題

単眼カメラからのリアルタイム稠密再構成は、深度を単純に読み取って融合できるRGB-Dマッピングよりもはるかに難しい。古典的な直接法(DSO)は精度良く追跡できるが、疎ないし準疎な点しか再構成できない。伝統的に精度の高いマルチビューステレオはオフラインで実行されており、完全に学習ベースの稠密SLAMは追跡精度において古典的手法に劣っていた。TANDEMは、単一の移動カメラからリアルタイムの追跡かつグローバルに整合した稠密マッピングを得る方法を問う、学習ベースのMVSを従来の最適化ベースVOに統合した最初のシステムである。

手法とアーキテクチャ

3つのコンポーネントが密接なループの中で動作する(VOはCPUスレッド上、MVS推論とTSDF融合は非同期にGPU上で実行される)。

1. 稠密フロントエンドを持つ視覚オドメトリ。 バックエンドはDSOの直接的な疎ウィンドウ付きフォトメトリックバンドル調整である。フロントエンドは、複合深度バッファを使い、直前のキーフレームに対する稠密な直接画像アライメントによって新しいフレームを追跡する。この複合深度バッファは、利用可能な場合はアクティブウィンドウの点からの疎な深度DnDSOD_{n}^{\text{DSO}}を使い、それ以外の場合は逐次構築されるグローバルTSDFモデルからレンダリングされた稠密な深度DnTSDFD_{n}^{\text{TSDF}}を使う — グローバルモデルに対して追跡する最初の単眼稠密フロントエンドであり、疎な点だけに基づく追跡に対する主要なロバスト性向上要因である。

2. CVA-MVSNet。 アクティブキーフレーム{(Ii,Ti)}i=1n\{(I_{i},\mathbf{T}_{i})\}_{i=1}^{n}が与えられると、重み共有の2D U-Netがマルチスケール特徴Fis\mathbf{F}_{i}^{s}を抽出する。参照キーフレームの深度は、解像度が上がる3段のカスケード段階で予測される。各段階では、特徴をピクセル単位の深度仮説Dhyps\mathbf{D}_{hyp}^{s}上にワーピングして特徴ボリュームVis\mathbf{V}_{i}^{s}を形成する。スライディングウィンドウ内のキーフレームは基線が非常に不均一である(強いオクルージョンや非重複がある)ため、各ビューを等しく重み付けする標準的な分散コストメトリックの代わりに、自己適応的ビュー集約が用いられる。

Cs=i=1,ijn(1+Wis)(VisVjs)2n1\mathbf{C}^{s}=\frac{\sum_{i=1,i\neq j}^{n}(1+\mathbf{W}_{i}^{s})\,\odot\,(\mathbf{V}_{i}^{s}-\mathbf{V}_{j}^{s})^{2}}{n-1}

ここでWis\mathbf{W}_{i}^{s}は、(VisVjs)2(\mathbf{V}_{i}^{s}-\mathbf{V}_{j}^{s})^{2}から浅い3D CNNによって予測されるボクセルごとの重みであり、ネットワークが誤ったビューの重みを下げられるようにする。コストボリュームは3D U-Netによって正則化され、ソフトマックスにより確率ボリュームPs\mathbf{P}^{s}に変換される。深度はその期待値である。

Ds[h,w]=d=1Ds  Ps[d,h,w]Dhyps[d,h,w]D^{s}[h,w]=\sum_{d=1}^{D^{s}}\;\mathbf{P}^{s}[d,h,w]\cdot\mathbf{D}_{hyp}^{s}[d,h,w]

後段の段階では、アップサンプリングされた前段の深度周辺で少数の仮説をサンプリングする(D1=48D^{1}=48平面を全範囲にわたって、その後より少数に絞る)。学習は3段すべてにわたるL1L_1損失の合計で行われる。

3. TSDF融合。 予測された深度マップはボクセルハッシュ化された切断符号付き距離関数グリッドに融合され、可視化されるメッシュと稠密追跡フロントエンドの両方が参照する整合したグローバルモデルを与える。

実験結果

SLAMにおける意義

TANDEMは、古典的手法と学習手法を組み合わせるハイブリッド設計パターンの明快な実例である。姿勢推定には理解の深い幾何学的推定器を残し、古典的手法が弱い部分(テクスチャの乏しい領域での稠密深度)にちょうど学習を挿入し、稠密マップを追跡へフィードバックさせる。単眼カメラでも深度センサーなしでオンラインに稠密なTSDFマップを生成できることを示し、DROID-SLAMのような完全学習パイプラインや、iMAP/NICE-SLAMのようなニューラルインプリシットシステムに対する実用的な代替として位置づけられる。

関連ノート