SceneCode
Zhi 2019 · 論文
一行要約 — CodeSLAMを拡張し、深度とセマンティックセグメンテーションをコンパクトな画像条件付き潜在コードとして符号化することで、セマンティックラベル融合を多視点コード最適化にし、幾何・姿勢・セマンティクスを単一の統合最適化で推定する。
問題
インクリメンタルなセマンティックマッピングシステムは幾何とセマンティクスの両方を保存し更新しなければならないが、幾何推定はよく発達した確率的な定式化を持つ一方で、最先端のシステムは表面要素(深度画素、サーフェル、ボクセル)ごとに独立したラベル推定を保存していた。空間的な相関が捨てられるため、融合されたラベルマップは不整合でノイズの多いものになり、セマンティックな証拠が動きや幾何の推定に情報を与えることができない。オブジェクトグラフによるアプローチ(SLAM++スタイル)は望ましいトークンのような性質を持つが、既知の離散的なオブジェクトのみを対象とする。SceneCodeは、セマンティクスをCodeSLAMの深度コードのような学習済みコンパクトコードに持たせられるか、つまりラベルを最適化可能で空間的に整合したマップ変数にできるかを問う。
手法とアーキテクチャ
マルチタスクCVAE。 共有ResNet-50エンコーダと2つのRefineNetデコーダを持つU字型ネットワークがカラー画像を処理する; 2つのVGG風変分エンコーダが深度とワンホットのセマンティックラベルを2つの低次元コード(、)に圧縮する。各デコーダは意図的にコードに関して線形であり、画像には非線形に条件付けられている。
ここではゼロコード(最も可能性の高い単一視点)の予測であり、は学習された線形の影響である——線形性によりコードのヤコビアンをキーフレームごとに一度だけ事前計算できる。学習は、予測されたピクセルごとの不確実性を伴う近接損失(近接度、m)、セマンティクスのための多クラス交差エントロピー、KLアニーリングされた変分損失、および適応的なタスク重み付けを組み合わせる。
多視点コード最適化による融合。 相対姿勢を用いて、密な対応が重なり合う視点を結びつける。3つの残差が最小化される: 光度残差、幾何残差(ワープされた点の深度整合性)、そして新しいセマンティック整合性残差
ここではソフトマックス確率間のユークリッド距離である——対応する画素は視点にかかわらず類似したカテゴリカル分布を持つべきである。はセマンティックコードと姿勢と深度に関して微分可能であるため、セマンティクスが動きと構造に影響を与えることができる(壁は壁に、椅子は椅子に整合する)。ゼロコード事前分布が、弱く固定されたセマンティック項を正則化する。
SLAMシステム。 キーフレームベースの単眼パイプライン: 各キーフレームは、、を保存する; トラッキングは光度残差のみを用いる; マッピングはNフレーム問題に対して減衰ガウス・ニュートン法を実行し、まず幾何+姿勢を最適化し、次にセマンティクスを、その後すべてを同時に最適化する。
実験結果
- データセット: NYUv2(学習/テスト795/654、13クラス)、Stanford 2D-3D-Semantic(66,792/3,704)、合成データセットSceneNet RGB-D(110,000/3,000のサブセット); 画像は256×192。再構成はコードサイズ32を超えると飽和し、以降ずっとこのサイズが用いられる; ゼロコード予測はセマンティクスにおいて識別的なRefineNetに匹敵し、深度においてはそれを上回る。
- ラベル融合(2,000枚のSceneNet RGB-D画像、完全なデータアソシエーション): コードベースの融合は要素ごとの融合を上回り、mIoUで最も明確に表れる——単一視点41.71; 2視点: 提案手法43.84対乗算42.33、平均42.22; 3視点44.23; 4視点44.26。総ピクセル精度は75.17→75.73(2視点)に上昇する。
- ゼロコード事前分布のアブレーション: この事前分布なしでは、2視点融合は39.60 mIoUに低下する——単一視点未満——これは学習された事前分布が不可欠であることを示す。
- システムデモ: NYUv2、SceneNet RGB-D、Stanfordにおける2視点密セマンティックSfM; 幾何事前分布は初期化を安定させ、純粋な回転運動でさえ扱えるようにする。
SLAMにおける意義
SceneCodeはSLAMにおける初の統合的な幾何・セマンティック潜在表現であり、セマンティクスが幾何にラベルを後付けするのではなく最適化可能なマップ変数となり得ることを示した——画素がもはや独立に扱われないため、融合されたラベルは滑らかで空間的に整合したものになる。それはインペリアル・カレッジの潜在マップ系譜(CodeSLAM → SceneCode → DeepFactors/NodeSLAM)に位置し、単一の暗黙表現が幾何とセマンティクスの両方を同様にデコードするセマンティック・ニューラルフィールドSLAMを概念的に予兆している。
関連ノート
- CodeSLAM — 深度のみの潜在コードの前身
- DeepFactors — コード上での確率的因子グラフSLAM
- NodeSLAM — オブジェクトレベルの潜在コード
- CodeMapping — スパースSLAMと並行する密なマッピングのためのコード
- SemanticFusion — より早期のサーフェル単位のセマンティック融合