SemanticFusion
McCormac 2016 · 論文
一行要約 — フレーム単位のCNNセグメンテーション予測を再帰的ベイズ更新によりElasticFusionのサーフェル地図に融合し、一貫した3D意味地図を生成する、初のリアルタイム密な意味SLAMシステム。
問題
密な幾何SLAMは正確な3D再構成を生成するが、その地図は何かが何であるかを知らない — ロボットの知能の次のレベルと直感的なユーザインタラクションのためには、地図は幾何と見え方を超えて意味を含む必要がある。一方、単一フレームのCNN意味セグメンテーションはノイズが多く、視点に依存する。同じ表面が異なる視点から異なるラベルを付けられることがある。欠けていたのは、多数のフレーム単位の2D予測を1つの永続的で一貫した3Dラベリングに蓄積する仕組みであった。
手法とアーキテクチャ
パイプラインは、任意の正則化器を加えて3つの単位が共に動作する構成である。
- SLAMバックボーン(ElasticFusion): 各フレーム について、ElasticFusionはICPとRGBアラインメントを組み合わせてカメラを追跡し、ポーズ を得て、深度をサーフェル地図に融合する。その変形グラフにより、確率分布が小さなループクロージングと大きなループクロージングの両方を通じてサーフェルと共に「運ばれる」ため、サーフェルは実世界の物体と永続的に関連付けられたままになる — これはまさに意味融合が必要とする長期的な対応関係である。(デフォルトパラメータ、ただし深度カットオフは3mから8mに拡張。)
- CNNフロントエンド: Deconvolutional Semantic Segmentationネットワーク(Nohら、VGG-16ベース、Caffe実装)が10フレームごとに実行され、13のNYUv2クラスに対する画素単位のクラス確率 を返す。4番目の深度チャンネルは、事前学習済みRGBフィルタの平均強度から深度フィルタを初期化し、0〜255のカラー範囲から0〜8mの深度範囲へ(約32倍)再スケーリングすることで追加される。入力は224×224にリスケールされ、出力は640×480にアップサンプリングされる。
- ベイズ的ラベル融合: 各サーフェル はラベルに関する離散分布 を保持し、一様分布で初期化される。追跡されたポーズを用いて、3D位置 にある各可視サーフェルは画素 に関連付けられ、以下のように再帰的に更新される。
ここで は正規化定数である。SLAMの対応関係こそが、多数の視点からのラベル仮説をベイズ的に組み合わせることを可能にするものである。
- 任意のCRF正則化: ガウス辺ポテンシャルを持つ完全連結CRFは各サーフェルをノードとして扱い、次の式を近似的に最小化することで分布を漸進的に更新する: 。ここで単項項は であり、Potts重み付けされた対項カーネルは、サーフェル位置 と色 に対する両側性の見え方カーネルと、法線 に対する平滑化カーネルである。
ここで m、、 radであり、500フレームごとに適用される。
フレームあたりのコスト(i7-5820K + Titan Black): SLAM 29.3ms、確率テーブルの管理1.0ms; CNN順伝播51.2msとベイズ更新41.1msが10フレームごと — 平均フレームレートは25.3Hzである。
実験結果
独自に構築したオフィス再構成データセット(ループのある軌跡、49の注釈付きテストフレーム、13のNYUv2クラス)では、予測を融合することでRGBD-CNNのクラス平均精度が43.6%から48.3%に向上し、最先端のEigenらのCNNは57.1%から60.0%に向上した。NYUv2テストセット(利用可能な140シーケンス、360枚のラベル付き画像)では、SemanticFusionはRGBD-CNNを55.6%から58.9%のクラス平均(62.0%から67.5%の画素平均)に、Eigenらの手法を59.9%から63.2%(+3.3%)に改善した。CRFの追加はさらにわずかな向上をもたらした(63.6%)。改善はオフィスデータセットではNYUv2の主に回転のみの軌跡と比較しておおよそ2倍である — 複数視点の融合は視点が変化する場合にこそ最も価値がある。全フレームで予測すると8.2Hzで52.5%の精度、10フレームごとでは25.3Hzで49〜51%となる。
SLAMにおける意義
SemanticFusionは「深層意味SLAM」を先駆的に開拓した。CNNによる認識と密なSLAMが相互補完的であることを示し、SLAMがフレーム単位の2D予測を永続的で一貫した3D意味地図に変換する対応関係を提供すること、そしてその融合が2Dラベリング自体さえも改善することを示した。これはFusion++、PanopticFusion、Kimera、そして今日の3Dシーングラフシステムへと至る意味マッピングの系統に直接的な影響を与えた。