ActiveSplat

Li 2025 · 논문

한 줄 요약 — 밀집 3D Gaussian Splatting 지도와 워크스페이스의 희소 보로노이 그래프 추상화를 결합하여, 로봇 스스로 재구성 완성도와 충실도를 최대화하기 위해 어디로 가고 어디를 볼지 결정하는 자율 능동 매핑 시스템(RA-L 2025)입니다.

문제

렌더링 기반 재구성(NeRF, 3DGS)은 장면 특화적이고 데이터 의존적이어서 “충분하지 않은 뷰 커버리지로 인해 흔히 발생하는 잡음과 아티팩트에 매우 민감”하며 — 품질은 촬영 궤적에 좌우됩니다. 능동 매핑은 이 문제를 뒤집습니다: 이동 에이전트가 즉석에서 재구성하고, 즉각적인 지도 품질을 평가하며, 전체 환경을 커버하는 경로를 계획합니다. 이를 위해서는 빠르고 사실적인 렌더링(뷰 품질 평가용)과 워크스페이스에 대한 효율적이고 안전한 계획을 모두 지원하는 표현이 필요합니다 — 이는 밀집 Gaussian 지도만으로는 제공되지 않으며, 볼류메트릭 신경 필드(ANM-S)는 수렴이 너무 느립니다.

방법 및 아키텍처

포즈가 부여된 RGB-D 입력에 대한 인식-행동 루프이며, 동일한 스플래팅 연산을 모두 재사용하는 세 개의 모듈로 구성됩니다:

C^k=i=1nkcifi(uk)j=1i1(1fj(uk)),O^k=i=1nkfi(uk)j=1i1(1fj(uk))\hat{C}_k=\sum_{i=1}^{n_k}\mathbf{c}_i f_i(\mathbf{u}_k)\prod_{j=1}^{i-1}(1-f_j(\mathbf{u}_k)), \qquad \hat{O}_k=\sum_{i=1}^{n_k}f_i(\mathbf{u}_k)\prod_{j=1}^{i-1}(1-f_j(\mathbf{u}_k))

최적화는 SplaTAM의 손실을 따릅니다. L=wcLpho+wdLgeoL=w_c L_{pho}+w_d L_{geo}이며 Lpho=λ1CkC^k+λ2(1SSIM(Ck,C^k))L_{pho}=\lambda_1|C_k-\hat{C}_k|+\lambda_2(1-\mathrm{SSIM}(C_k,\hat{C}_k)), Lgeo=DkD^kL_{geo}=|D_k-\hat{D}_k| (λ1=0.8,λ2=0.2,wc=0.5,wd=1.0\lambda_1{=}0.8, \lambda_2{=}0.2, w_c{=}0.5, w_d{=}1.0)입니다. 누적 불투명도가 τo1=0.98\tau_{o1}=0.98 미만이거나 깊이가 ϵMDE\epsilon_{\mathrm{MDE}}(중앙값 깊이 오차의 50배)를 넘어 벗어나는 곳에서 새로운 Gaussian이 생성됩니다.

Si=woso(i)+wcsc(i)+wusu(i)+whsh(i)S_i = w_o\, s_o(i) + w_c\, s_c(i) + w_u\, s_u(i) + w_h\, s_h(i)

이며 wo=20w_o{=}20, wc=wu=wh=10w_c{=}w_u{=}w_h{=}10입니다: so,scs_o,s_c는 2D 비가시 면적 및 3D 볼록 껍질 비율이고, su,shs_u,s_h는 미방문/시야 내부 여부를 나타내는 불리언 플래그입니다. Dijkstra 알고리즘이 선택된 노드까지의 최단 경로를 계획합니다.

실험 결과

Habitat 시뮬레이터를 Gibson과 Matterport3D에서 사용(단층 장면 13개; 작은 장면은 1000 스텝, 중간 장면은 2000 스텝), RTX 3090, 5회 시행 평균:

SLAM에서의 의미

대부분의 3DGS-SLAM 연구(SplaTAM, MonoGS, Photo-SLAM)는 카메라 궤적을 주어진 것으로 취급하지만, ActiveSplat은 매핑과 행동 사이의 루프를 닫습니다. 핵심 통찰은 아키텍처적입니다: 하나의 스플래팅 연산이 지도 갱신, 뷰포인트 점수화, 워크스페이스 추출을 모두 서비스하며, 토폴로지 그래프는 계획을 희소하고 안전하게 유지합니다 — 이러한 역할 분담이 온라인 능동 재구성을 다룰 수 있게 만듭니다. 이는 검사, 디지털 트윈, 시뮬레이션 데이터 수집을 위해 수동적 SLAM에서 임바디드, 탐색 주도적 재구성으로의 전환을 대표합니다.

관련 문서