NICE-SLAM
Zhu & Peng 2022 · 論文
一行要約 — スケーラブルなニューラル陰関数SLAMのために、複数レベルの局所特徴グリッド(粗・中・細)による階層的シーン表現を導入し、大規模シーンにおけるiMAPの限界を克服した。
問題
ニューラル陰関数表現はiMAPによってSLAMに導入されたばかりであったが、「既存の手法は過度に平滑化されたシーン再構成を生み、大規模シーンへのスケールアップが難しい」——この限界は「主に、観測内の局所情報を取り込まない単純な全結合ネットワークアーキテクチャに起因する」(概要より)。単一の大域MLPは、新しい部分的なRGB-D観測が来るたびに大域的に更新しなければならず、そのため新しい領域を学習する際に古い領域を忘れてしまう。NICE-SLAM(CVPR 2022)は、事前学習済みネットワークによってデコードされる複数レベルの特徴グリッドに情報を局所的に格納する表現によってこれを解決する。
手法とアーキテクチャ
シーンは4つの特徴グリッドで符号化される。凍結されたMLPデコーダーを持つ3つの幾何グリッド(、粗(2mボクセル、未観測の幾何を外挿)・中(32cm)・細(16cm)レベル)と、デコーダーを持つ1つの色グリッドである。点は三線形補間でデコードされる。中レベルは占有度を与え、細レベルは中レベルの特徴を条件とした残差を加える。
色はである。粗・中・細のデコーダーはConvONetの一部として事前学習され、その後凍結される——グリッド特徴のみが最適化される——これにより最適化が安定化し、学習済みの室内幾何事前分布が注入される。粗グリッドは観測領域外の占有度を予測できるため、視野の大部分が新規であってもトラッキングが維持される。
レンダリング: 各レイに沿って点がサンプリングされる(層化サンプリングに加えて計測深度付近のサンプル)。点でのレイ終端確率はであり、深度・色は次のようにレンダリングされる。
レイごとの深度分散も粗・細レベルで計算される。
マッピングは現在のフレームと選択されたキーフレームからピクセルをサンプリングし、段階的に最適化する。まず深度損失による中グリッドのみ、次に中+細、そしてポーズも個のキーフレームに対して精緻化する局所バンドル調整である(は色損失)。トラッキングは並行して動作し、現在のフレームのをで最適化する。ここで
は、物体の輪郭のような不確かな領域を重み下げする。損失がフレーム中央値の10倍を超えるピクセルは除外され、動的物体に対する頑健性が得られる。キーフレームは、現在のビューと視覚的な重なりを持つフレームの中からのみ選択される——グリッド更新が局所的であるため可能なことで、視野外の幾何は固定されたままとなる(構造上、破滅的忘却が起きない)。システムは3つのスレッド(粗マッピング、中/細+色マッピング、トラッキング)で動作する。
実験結果
Replica、ScanNet、TUM RGB-D、Co-Fusion、自前撮影の複数部屋アパートの5つのデータセットで評価。
- Replica(8シーンの平均): 深度L1 3.53cm、精度2.85cm、完全性3.00cm、完全性比率89.33%——iMAP*の7.64/6.95/5.33cm/66.60%、DI-Fusionの23.33/19.40/10.19cm/72.96%に対して——モデルサイズ12.02MB。
- ScanNetトラッキング: 6シーン平均のATE RMSEが9.63cm、対してiMAP*は36.67cm、DI-Fusionは78.89cm; アブレーションから、局所BAと色損失の両方が重要であることが分かる(局所BAなし: 37.74)。
- TUM RGB-D: fr1/desk、fr2/xyz、fr3/officeでATE RMSEが2.7/1.8/3.0cm——陰関数手法の中では最良(iMAP: 4.9/2.0/5.8)だが、古典的なORB-SLAM2の方が依然優れている(1.6/0.4/1.0)。
- 計算量: クエリ点あたり104.16×10³ FLOPsに対しiMAPは443.91×10³; トラッキング47ms、マッピング130ms(1反復あたり)に対しiMAPは101/448ms。
SLAMにおける意義
NICE-SLAMは、ニューラル陰関数SLAMを部屋サイズ以上の環境へスケール可能にし、この分野をiMAPの概念実証段階から先へ進めた。その階層的特徴グリッド設計は、ESLAM(三平面)、Co-SLAM(ハッシュグリッド)、Point-SLAM(ニューラルポイント)といった後続研究に採用された標準的なパターンとなった。iMAPと共に、後の多くのニューラルSLAM論文で使われるReplica/TUM RGB-D/ScanNet評価プロトコルを確立した。