MaskFusion

Rünz 2018 · 論文

一行要約 — 複数の動く物体を、世界全体を1つの剛体シーンとして扱う代わりに、個別のセマンティックなサーフェルモデルとして認識・セグメント化・追跡・再構成するリアルタイムRGB-D SLAMシステム。

問題

従来のSLAMシステムは「静的シーンの純粋に幾何学的な地図を出力」するのみで、動くものは無視すべきアウトライアとして扱われ、地図はそこに含まれる物体について何も語らない。以前の認識ベースのSLAM(例えばSLAM++)は物体を追跡できたが、事前にスキャンした3Dモデルを持つ物体のみが対象であった。また、セマンティクスを備えた高密度SLAM(SemanticFusion)は地図上の点を固定カテゴリにラベル付けするが、インスタンスを区別しなかった。MaskFusionはこれらの組み合わせを目指す。すなわち、物体を意識し、セマンティックであり、かつ動的である — 既知のモデルを持たない複数の独立して動く物体をリアルタイムで認識・セグメント化・再構成する。

手法とアーキテクチャ

MaskFusionはマルチモデルSLAMシステムである。背景モデルに加え、認識された物体ごとに1つのサーフェルモデル Mm\mathcal{M}_mm{0..N}m \in \{0..N\} を保持する(ElasticFusionの表現で、各サーフェルは位置、法線、色、重み、半径、タイムスタンプを格納する)。各モデルは剛体姿勢 Rtm,ttm\mathbf{R}_{tm}, \mathbf{t}_{tm} と静的/動的フラグを持ち、静的でない物体のみが別途追跡される(物体は動きの不整合、または人がそれに触れたときに動的と判定される)。1フレームあたり3つのステージが実行される。

追跡。 各追跡対象モデルの姿勢増分 ξmse(3)\xi_m \in \mathfrak{se}(3) は、前回の姿勢でレンダリングされたモデルに対する幾何学的・光度学的な結合エネルギーを最小化する。

Em=minξm(Emicp+λEmrgb)E_m = \min_{\xi_m}\,(E^{icp}_m + \lambda E^{rgb}_m)

射影的な点対平面ICP項と輝度不変項からなる。

Emicp=i((viexp(ξm)vti)ni)2,Emrgb=uΩ(It(u)It1a(π(exp(ξm)π1(u,Dt))))2,E^{icp}_m = \sum_i \left((\mathbf{v}^i - \exp(\xi_m)\,\mathbf{v}^i_t)\cdot\mathbf{n}^i\right)^2, \qquad E^{rgb}_m = \sum_{\mathbf{u}\in\Omega}\left(\mathcal{I}_t(\mathbf{u}) - \mathcal{I}^a_{t-1}\big(\pi(\exp(\xi_m)\,\pi^{-1}(\mathbf{u},\mathcal{D}_t))\big)\right)^2,

ここで vi,ni\mathbf{v}^i,\mathbf{n}^i はレンダリングされたモデルの頂点/法線、vti\mathbf{v}^i_t は逆投影された現在の頂点、Dt,It\mathcal{D}_t,\mathcal{I}_t は現在の深度/輝度マップ、π\pi は透視投影である。4段階の粗密ピラミッド上でGauss–Newton法によって解かれる(CUDA実装)。

セグメンテーション。 Mask R-CNNはインスタンスマスクとクラスラベル(COCOの80クラス)を与えるが、動作は約5 Hzに過ぎず、境界が背景に漏れ出るため、フレームキュー(長さ12、約400 msの遅延)上で非同期に実行される。一方、フレームごとの幾何学的セグメンテーションが鮮明でリアルタイムな境界を供給する。ピクセルは ϕd+λ^ϕc>τ\phi_d + \hat{\lambda}\phi_c > \tau のときエッジと判定され、深度不連続項 ϕd=maxiN(viv)n\phi_d = \max_{i\in\mathcal{N}} |(\mathbf{v}_i - \mathbf{v})\cdot\mathbf{n}| と、局所近傍 N\mathcal{N} 上での類似の凹面度項 ϕc\phi_c を用いる。エッジマップの連結成分はセマンティックマスクに対応付けられ(重複度65%以上)、マスクは既存のモデルに対応付けられる(投影されたモデルラベル、クラスIDの一致による)。残った成分は直接モデルに対応付けられ、などのクラスは融合から完全に除外できる。

融合。 サーフェルはElasticFusionと同様に射影的なデータ対応によって更新されるが、最終的なセグメンテーションによってステンシル処理され、各新規サーフェルは正確に1つのモデルに属するようにされる。不完全なマスクを吸収するため、ステンシル外のサーフェルには信頼度のペナルティが課される。

実験結果

SLAMにおける意義

MaskFusionは「静的な世界におけるSLAM」から動的で物体を意識したSLAMへの転換における画期的な成果である。既知の物体モデルなしに、物体ごとの高密度モデルとセマンティックラベルをリアルタイムで維持できることを示した。この研究の流れは、ロボットの操作やAR場面を支えている。そこではシーンの興味深い部分こそが、まさに動く物であり — 動く物体を削除する地図は、それを把持しなければならないロボットには無用である。MID-Fusionとともに、この研究は物体レベルの動的SLAMの手法を確立し、後にVDO-SLAMやDynaSLAM IIが最適化バックエンドにおいて形式化した。

関連ノート