ActiveSplat
Li 2025 · 논문
한 줄 요약 — 밀집 3D Gaussian Splatting 지도와 워크스페이스의 희소 보로노이 그래프 추상화를 결합하여, 로봇 스스로 재구성 완성도와 충실도를 최대화하기 위해 어디로 가고 어디를 볼지 결정하는 자율 능동 매핑 시스템(RA-L 2025)입니다.
문제
렌더링 기반 재구성(NeRF, 3DGS)은 장면 특화적이고 데이터 의존적이어서 “충분하지 않은 뷰 커버리지로 인해 흔히 발생하는 잡음과 아티팩트에 매우 민감”하며 — 품질은 촬영 궤적에 좌우됩니다. 능동 매핑은 이 문제를 뒤집습니다: 이동 에이전트가 즉석에서 재구성하고, 즉각적인 지도 품질을 평가하며, 전체 환경을 커버하는 경로를 계획합니다. 이를 위해서는 빠르고 사실적인 렌더링(뷰 품질 평가용)과 워크스페이스에 대한 효율적이고 안전한 계획을 모두 지원하는 표현이 필요합니다 — 이는 밀집 Gaussian 지도만으로는 제공되지 않으며, 볼류메트릭 신경 필드(ANM-S)는 수렴이 너무 느립니다.
방법 및 아키텍처
포즈가 부여된 RGB-D 입력에 대한 인식-행동 루프이며, 동일한 스플래팅 연산을 모두 재사용하는 세 개의 모듈로 구성됩니다:
- 하이브리드 지도 갱신: 각 Gaussian은 색상 , 중심 , 공분산 , 불투명도 를 가지며, 픽셀별 영향력은 입니다. 색상, 깊이, 그리고 가시성(누적 불투명도)은 모두 전후방 블렌딩으로 렌더링됩니다:
최적화는 SplaTAM의 손실을 따릅니다. 이며 , ()입니다. 누적 불투명도가 미만이거나 깊이가 (중앙값 깊이 오차의 50배)를 넘어 벗어나는 곳에서 새로운 Gaussian이 생성됩니다.
- 워크스페이스 추상화: Gaussian 지도의 하향 정사영 렌더링(큰 초점 거리)이 점유도를 산출합니다. 장애물을 제외한 이동 가능한 지면 영역이 워크스페이스를 이루며, 여기서 보로노이 그래프 가 테셀레이션됩니다 — 에지는 장애물로부터 등거리에 있으므로 그 위의 경로는 본질적으로 안전합니다.
- 분리된 뷰포인트 선택: 위치 후보는 오직 보로노이 노드들뿐이며, 회전은 노드마다 세 개의 가상 카메라로부터 가시성 파노라마를 렌더링하고 저가시성 영역을 DBSCAN으로 클러스터링하여 선택됩니다(클러스터 중심이 요/피치를 제공). 2D 비가시 픽셀 면적이 실제 미관측 부피를 과대/과소 평가하므로, 윤곽 픽셀을 역투영하고 볼록 껍질로 누락된 3D 부피를 근사합니다. 불투명도는 신뢰할 만한데() 렌더링된 깊이가 관측과 불일치하는() 고손실 샘플 집합도 함께 유지됩니다. 노드 점수는
이며 , 입니다: 는 2D 비가시 면적 및 3D 볼록 껍질 비율이고, 는 미방문/시야 내부 여부를 나타내는 불리언 플래그입니다. Dijkstra 알고리즘이 선택된 노드까지의 최단 경로를 계획합니다.
- 계층적 계획: 보로노이 그래프는 유클리드 거리와 이동 거리를 결합한 응집 클러스터링(UPGMA)을 통해 서브영역으로 동적으로 분할됩니다. 에이전트는 다음으로 좋은 전역 서브영역으로 넘어가기 전에 지역 서브영역을 다 소진합니다 — 다중 방 장면에서 탐욕적 점수화의 반복적인 궤적을 피합니다.
- 후처리: Gaussian이 일관된 파라미터 공간을 유지하므로, 저장된 키프레임을 이용하여 3DGS/2DGS 밀도 제어와 깊이/노멀 정규화를 통한 오프라인 정제가 가능합니다.
실험 결과
Habitat 시뮬레이터를 Gibson과 Matterport3D에서 사용(단층 장면 13개; 작은 장면은 1000 스텝, 중간 장면은 2000 스텝), RTX 3090, 5회 시행 평균:
- 커버리지 (완성 비율 % / 완성 오차 cm): Gibson 92.24 / 2.43, MP3D 92.48 / 2.84 — ANM-S(92.10/2.83, 89.74/4.14), NARUTO(79.16/3.52, 84.90/5.94), ANM(80.45/7.44), UPEN 및 프론티어 기반 FBE(68.30/14.42, 74.30/9.29)를 능가.
- 렌더링 대 ANM-S (테스트 뷰, 후처리 적용): 예를 들어 Gibson-Eudora PSNR 27.82 대 24.55, 깊이 L1 1.63 대 5.34 cm; Gibson-Ribera 30.86 대 26.51, 1.85 대 13.90 cm.
- 어블레이션: 무작위 노드 순회 84.20%(Gibson) → 위치 전용 탐욕 90.41 → 분리된 뷰포인트 91.76 → 계층적 계획을 포함한 전체 버전 92.24; 가시성 전용 또는 볼록 껍질 전용 점수화 모두 조합보다 성능이 낮음. 2DGS + 깊이 손실을 이용한 후처리는 Gibson-Denmark에서 테스트 뷰 깊이 L1을 9.01에서 7.56 cm로, PSNR을 21.72에서 27.58로 개선; 깊이 손실이 없으면 기하가 저하됨(과적합).
- 실행 시간: 헤드리스 상태에서 약 8 fps; 매퍼 45.14 ms와 워크스페이스 추출 43.87 ms가 스텝당 지배적이며, 계획 자체는 밀리초 미만.
- 실제 환경: Azure Kinect를 장착한 Agile-X Ranger Mini에 배치되었으며, 자세는 병렬 스레드에서 실행되는 라인 기반 SLAM 시스템에서 얻음.
SLAM에서의 의미
대부분의 3DGS-SLAM 연구(SplaTAM, MonoGS, Photo-SLAM)는 카메라 궤적을 주어진 것으로 취급하지만, ActiveSplat은 매핑과 행동 사이의 루프를 닫습니다. 핵심 통찰은 아키텍처적입니다: 하나의 스플래팅 연산이 지도 갱신, 뷰포인트 점수화, 워크스페이스 추출을 모두 서비스하며, 토폴로지 그래프는 계획을 희소하고 안전하게 유지합니다 — 이러한 역할 분담이 온라인 능동 재구성을 다룰 수 있게 만듭니다. 이는 검사, 디지털 트윈, 시뮬레이션 데이터 수집을 위해 수동적 SLAM에서 임바디드, 탐색 주도적 재구성으로의 전환을 대표합니다.