OpenGS-SLAM
Yang 2025 · 논문
한 줄 요약 — 3D 가우시안 위의 오픈셋 밀집 의미론적 RGB-D SLAM으로, 특징 벡터를 임베딩하는 대신 각 가우시안이 하나의 명시적 레이블을 가지며, 가우시안 투표 스플래팅과 신뢰도 기반 다중 뷰 레이블 합의가 노이즈가 많은 2D 파운데이션 모델 분할을 일관되고 물체 수준의 3D 지도로 변환합니다.
문제
기존 의미론적 SLAM 시스템은 “일반적으로 제한된 카테고리의 사전 학습된 분류기와 암시적 의미론적 표현에 제약을 받아, 오픈셋 상황에서의 성능을 저해하고 3D 물체 수준 장면 이해를 제한한다”. 특징 임베딩 방식의 3DGS 방법 (SemGauss-SLAM, NEDS-SLAM)은 가우시안마다 N채널 임베딩을 저장하므로, 개별 가우시안의 레이블을 직접 읽어낼 수 없어 물체 수준 상호작용이 막히고, 렌더링/저장 비용이 급증합니다. 명시적 레이블에는 세 가지 장애물이 있습니다: (1) 레이블은 미분 불가능하여 표준 3DGS 래스터라이저에 실을 수 없습니다; (2) SAM 방식 분할기는 뷰마다 일관성이 없습니다 (동일한 물체에 다른 레이블이 붙거나, 부분으로 나뉩니다); (3) 약하게 제약된 가우시안이 과도하게 커져 세그먼트 경계를 뭉갭니다.
방법 및 아키텍처
GS-ICP SLAM (G-ICP가 추적을 담당)에 기반하며, 입력은 사전 정의된 의미론적 카테고리 없이 RGB-D 스트림입니다:
- 앙상블 의미론적 정보 생성기: RAM이 이미지에 오픈셋 클래스를 태깅하고, 이는 YOLO-World가 검출 점수를 가진 의미론적 박스를 생성하도록 유도합니다. SAM (또는 MobileSAMv2)은 신뢰도가 있지만 무작위 레이블 ID를 가진 레이블 맵을 생성합니다. 마스크와 박스는 IoU (> 0.5)로 매칭되어 입력 레이블-클래스 테이블 를 이룹니다. 전역 테이블 는 SLAM 도중 빈 집합에서 동적으로 성장합니다.
- 의미론적 가우시안 표현: 각 가우시안은 중심 , 공분산 , 불투명도 , 색상 , 그리고 1차원 미분 불가능한 GS 레이블 을 가집니다 — N채널 특징 임베딩을 대체합니다.
- 가우시안 투표 스플래팅: 가우시안은 를 통해 이미지에 투영되며, 색상과 깊이를 위해 앞에서 뒤로 알파 합성됩니다, . 레이블의 경우, 기여하는 각 가우시안이 자신의 블렌딩 가중치로 투표합니다
그리고 픽셀은 누적 가중치 가 가장 높은 레이블 를 취합니다. 픽셀당 상위 개 기여자가 에 기록되어, 픽셀의 레이블이 에서 로 바뀌면 책임이 있는 가우시안을 찾아 명시적으로 재레이블링할 수 있습니다 — 그래디언트 없이도 빠른 레이블 렌더링 및 장면 갱신이 가능합니다.
- 신뢰도 기반 2D 레이블 합의: 입력 레이블 는 네 가지 경우 아래에서 현재 지도로부터 렌더링된 레이블 과 매칭됩니다 — 완전 매칭 (지도 레이블 채택, 최대 신뢰도 유지), 부분 매칭 (부분들이 영역 가중 신뢰도 로 투표하며, 더 신뢰도 높은 쪽이 승리), 전체 매칭 (대칭적인 경우), 신규 레이블 (임계값 ). 두 가지 개선책: 입력 신뢰도 갱신은 부분적으로만 보이는 물체의 레이블 가중치를 낮춥니다 (물체별 보이는-대-전체 가우시안 비율 기준). 부분 레이블 감쇠는 레이블이 부분으로 관측될 때마다 신뢰도에서 을 빼는데, 이를 통해 반복 관측을 거치며 SAM의 만성적인 과분할이 치유됩니다.
- 분할 카운터 프루닝: 완전히 매칭된 레이블 쌍에 대해, 두 마스크의 대칭 차집합 (“카운터 가우시안”)에 속하며 스케일이 (Replica 0.10 / TUM 0.25)를 초과하는 가우시안이 제거되어, 물체 윤곽에서 새롭고 더 잘 맞는 가우시안을 위한 공간을 복원합니다.
실험 결과
- 닫힌 집합 의미론적 분할 (Replica, 실측 의미론적 사전 정보를 입력으로): 8개 장면 모두에서 최고 mIoU, 예를 들어 R0 93.24 / Of4 93.77, 대 SGS-SLAM 92.95 (R0), SNI-SLAM 88.42.
- 제로샷 오픈셋 새로운 뷰 분할 (Replica 평균): Ours(SAM1.0) mIoU 61.91 / Acc 73.11, 165.47 FPS, 학습 가능 파라미터 301.71 MB — 대 GS-Grouping 59.15 / 69.94 (16.14 FPS, 717.12 MB), Feature 3DGS 48.89 / 57.51 (11.03 FPS, 894.91 MB) — 약 10배 더 빠른 의미론적 렌더링과 약 2배 낮은 저장소를 주장합니다.
- 추적/매핑 (Replica 평균): ATE 0.16 cm — 다른 밀집 의미론적 SLAM 대비 최대 51% 상대적 향상 (SemGauss-SLAM 0.33, SGS-SLAM 0.41), 표 내 최고 수준의 PSNR 39.49와 LPIPS 0.034. TUM에서: 평균 ATE 2.15 cm (fr1-desk 2.40, fr2-xyz 1.57, fr3-office 2.48), SplaTAM (3.25)과 GICP-SLAM (2.28)을 앞섭니다.
- 어블레이션 (Replica, SAM1.0 기준선 63.17 mIoU / 74.51 Acc): 부분 레이블 감쇠 제거는 5.96 mIoU / 10.2 Acc 손실; 입력 신뢰도 갱신 제거는 3.39 / 5.4 손실; 카운터 프루닝 제거는 0.26 / 1.49 손실 (주로 경계를 선명하게 만드는 역할이며, 논문은 더 깨끗한 윤곽이 G-ICP 정렬을 개선하기 때문에 추적 성능 향상도 이 기법 덕분이라고 밝힙니다).
- 명시된 한계: 동적 장면에는 적용할 수 없습니다.
SLAM에서의 의미
OpenGS-SLAM은 3DGS 기반 밀집 SLAM과 2D 파운데이션 모델이 견인하는 오픈 어휘 매핑의 교차점에 위치합니다. 이 논문의 이산 레이블 투표 방식은 물체 수준의 오픈셋 장면 이해가 모든 지도 프리미티브에 무거운 언어 특징을 임베딩할 필요가 없음을 보여줍니다 — 이는 ConceptFusion/LERF 스타일 지도의 주된 비용 문제입니다 — 그리고 (물체를 제거, 이동, 선택하는) 상호작용 작업에 정확히 필요한 것은 명시적인 가우시안별 레이블임을 보여줍니다. 또한 의미론적 부기 (bookkeeping)가 기하학에 도움이 될 수 있음을 입증합니다: 잘못 레이블링된 과대 가우시안을 제거하는 것이 실제로 G-ICP 추적을 개선했습니다.