NodeSLAM
Sucar 2020 · 論文
一行要約 — 検出された各物体を、クラス条件付きVAEによってデコードされるコンパクトな学習済み占有コードとして表現するオブジェクトレベルSLAMであり、新規の確率的微分可能レンダラーを用いて物体形状・物体姿勢・カメラ軌跡を同時に最適化する。
問題
シーン表現の選択は、SLAMシステムが必要とする推論アルゴリズムと、それが可能にするアプリケーションの両方を決定する。点群やサーフェル地図には物体の同定・姿勢・完全な形状という概念がない——しかしロボットがマグカップを把持したり箱を詰めたりするには、まさにそれらが必要である。古典的な再構成は直接観測された表面のみを復元でき、フィードフォワード型の形状予測は複数の測定を原理的な方法で統合できない。NodeSLAMは、1枚以上のRGB-D画像から、SLAM様の同時推定の内部で原理的な完全な物体形状推論を行うことを目指し、物体ごとのTSDFシステム(Fusion++)とCADモデルインスタンスシステムの間のギャップを埋める。
手法とアーキテクチャ
形状モデル。 単一のクラス条件付き3D CNN VAE(畳み込み層5層、カーネル4、ストライド2;左右対称なデコーダ)が、4つの卓上物体クラス(マグカップ、ボウル、ボトル、缶)について サイズのShapeNet占有グリッド上で学習される。KL潜在損失とバイナリクロスエントロピー再構成損失を用いる。地図中の各物体は、サイズ16の潜在コード と9自由度の姿勢(回転、並進、スケール)で表される。
確率的レンダリング(測定関数)。各ピクセルについて、逆投影された光線に沿って 個の深度 をサンプリングし、デコードされたグリッドから三線形補間された占有値 を取得する。光線の終端確率と脱出確率は
であり、レンダリングされた深度とピクセル単位の不確実性はこの分布の平均と分散として得られる:
複数物体のレンダリングは最小深度によって統合され(遮蔽処理)、4レベルのガウシアンピラミッドが受容野を拡大し、粗から精細への最適化を可能にする。
推論。 コードに対するガウス事前分布のもとで、MAP問題はレーベンバーグ・マルカート法で解かれる最小二乗目的関数となる:
並進とスケールはマスク化された点群から初期化され、向きは検出された支持平面から初期化される(マグカップのヨー角にはCNNを併用)。(クラス平均形状)とする。
SLAMループ。 Mask R-CNNのマスクは2段階(前フレームのマスクIoU>0.2、その後レンダリングされたマスクIoU)で地図上の物体に関連付けられ、マッチしないマスクは新たな物体を生成する。カメラトラッキングは、地図を固定した状態で同じレンダリング損失を最小化する。キーフレーム(物体が初期化された時、または視点変化が13°を超えた時に生成)は、カメラ姿勢・物体姿勢・形状コードに関する3キーフレームのスライディングウィンドウ同時最適化に入る:。処理時間:物体1個のレンダリングに7ms、完全な物体再構成に約1.5秒、トラッキング7fps、同時最適化2秒。
実験結果
- ShapeNetのマグカップに対するマルチビュー形状最適化(表1):3視点で精度3.48mm、chamfer- 3.65mm、完成率96.1%であり、局所受容野レンダラーを用いるDVRの8.28mm / 10.91mm / 44.8%を上回る;不確実性またはガウシアンピラミッドを取り除くと全指標が一貫して悪化し、収束もDVRより大幅に速い。
- 未知のModelNet40物体10個ずつを含む5つの合成シーンでのFusion++様TSDFベースラインとの比較:形状の完成度は最初の数視点でほぼ完全な状態に達する(TSDFは各フレームを融合するたびに徐々に完成する)一方、表面精度は約5mmで同程度である。
- トラッキングのアブレーション(表2):完全なシステムでの5シーンにわたる平均絶対姿勢誤差は0.81〜1.73cm;同時最適化なしでは誤差は最大10.17cmまで増大し、不確実性レンダリングなしでは最大6.99cmまで増大する。
- 実世界での実証:ノイズの多い深度カメラを用いた乱雑な卓上SLAM、ARデモ、そして再構成されたマグカップ・ボウル・ボトルの完成メッシュを用いて仕分けと梱包を行うリアルタイムロボット。
SLAMにおける意義
NodeSLAMは現代のオブジェクトレベルSLAMのパラダイムを確立した:学習された形状事前知識を、古典的な同時推定内の最適化可能な地図変数として扱い、微分可能レンダリングを測定モデルとして用いる——これは後の神経フィールドSLAMを支える「レンダラーを逆転させる」考え方と同じである。姿勢を伴う完全な物体モデルは、生の断片的な幾何情報とは異なり、ロボットマニピュレーションが必要とするものそのものである。これは、コードベースの密なSLAM(CodeSLAM)から、物体中心の神経フィールドマッピング(vMAP)やDSP-SLAMのようなDeepSDFベースのシステムへの概念的な橋渡しである。
関連ノート
- CodeSLAM — NodeSLAMが物体レベルに引き上げるフレームレベルの潜在コードの発想
- DSP-SLAM — ORB-SLAM2バックボーン上のDeepSDF物体事前知識
- vMAP — オブジェクトレベルの神経フィールド後継手法
- Fusion++ — 学習された形状事前知識を用いないオブジェクトレベルTSDFマッピング
- MoreFusion — 同じ研究室・同時代のマニピュレーション向けオブジェクトレベル融合