ActiveSplat

Li 2025 · 論文

一行要約 — 密な3D Gaussian Splattingマップと、ワークスペースの疎なVoronoiグラフによる抽象化を組み合わせた自律的アクティブマッピングシステム(RA-L 2025)。ロボット自身が、再構成の完全性と忠実度を最大化するために、どこへ行き、どこを見るかを決定する。

問題

レンダリングベースの再構成(NeRF、3DGS)はシーン固有かつデータ依存であるため、「視点カバレッジが不十分なために生じることが多いノイズやアーティファクトに非常に敏感」であり、品質は撮影軌跡に大きく左右される。アクティブマッピングはこの問題を反転させる。移動エージェントがその場で再構成を行い、即時のマップ品質を評価し、環境全体をカバーする経路を計画するのである。これには、高速で写実的なレンダリング(視点品質評価用)と、ワークスペース上での効率的かつ安全な計画の両方をサポートする表現が必要であり、これは密なGaussianマップ単体では提供できず、また体積ニューラルフィールド(ANM-S)は収束が遅すぎて対応できない。

手法とアーキテクチャ

姿勢付きRGB-D入力に対する知覚-行動ループであり、3つのモジュールがすべて同じスプラッティング演算を再利用する。

C^k=i=1nkcifi(uk)j=1i1(1fj(uk)),O^k=i=1nkfi(uk)j=1i1(1fj(uk))\hat{C}_k=\sum_{i=1}^{n_k}\mathbf{c}_i f_i(\mathbf{u}_k)\prod_{j=1}^{i-1}(1-f_j(\mathbf{u}_k)), \qquad \hat{O}_k=\sum_{i=1}^{n_k}f_i(\mathbf{u}_k)\prod_{j=1}^{i-1}(1-f_j(\mathbf{u}_k))

最適化はSplaTAMの損失関数に従い、L=wcLpho+wdLgeoL=w_c L_{pho}+w_d L_{geo}Lpho=λ1CkC^k+λ2(1SSIM(Ck,C^k))L_{pho}=\lambda_1|C_k-\hat{C}_k|+\lambda_2(1-\mathrm{SSIM}(C_k,\hat{C}_k))Lgeo=DkD^kL_{geo}=|D_k-\hat{D}_k|(λ1=0.8,λ2=0.2,wc=0.5,wd=1.0\lambda_1{=}0.8, \lambda_2{=}0.2, w_c{=}0.5, w_d{=}1.0)である。新しいGaussianは、累積不透明度がτo1=0.98\tau_{o1}=0.98を下回る場所、あるいは深度がϵMDE\epsilon_{\mathrm{MDE}}(深度誤差の中央値の50倍)を超えて偏差する場所に生成される。

Si=woso(i)+wcsc(i)+wusu(i)+whsh(i)S_i = w_o\, s_o(i) + w_c\, s_c(i) + w_u\, s_u(i) + w_h\, s_h(i)

であり、wo=20w_o{=}20wc=wu=wh=10w_c{=}w_u{=}w_h{=}10である。so,scs_o,s_cは2D不可視面積および3D凸包の割合、su,shs_u,s_hは未訪問/視界内かを示す真偽フラグである。選択されたノードへの最短経路はDijkstraで計画される。

実験結果

HabitatシミュレータでGibsonとMatterport3D(13の単一フロアのシーン。小規模シーンは1000ステップ、中規模シーンは2000ステップ)、RTX 3090、5回の試行の平均:

SLAMにおける意義

3DGS-SLAMの研究の多く(SplaTAM、MonoGS、Photo-SLAM)はカメラ軌跡を所与として扱うが、ActiveSplatはマッピングと行動の間のループを閉じる。その核心的な洞察はアーキテクチャ的である。1つのスプラッティング演算がマップ更新、視点スコアリング、ワークスペース抽出のすべてに供され、トポロジカルグラフが計画を疎かつ安全に保つ。この分業が、オンラインのアクティブ再構成を実現可能にしている。これは、パッシブなSLAMから、検査、デジタルツイン、シミュレーションデータ取得のための、身体性を持つ探索駆動型再構成への移行を代表する研究である。

関連ノート