LEGS
Yu 2024 · 논문
한 줄 요약 — Language-Embedded Gaussian Splats: 모바일 로봇이 주행하면서 스케일 조건화된 CLIP 특징 필드를 갖춘 방 규모의 3DGS 지도를 온라인으로 점진적으로 구축하여, LERF의 개방형 어휘 질의 성공률에 맞먹으면서 3.5배 빠르게 학습합니다.
문제
의미론적 3D 지도는 “사무실, 창고, 매장, 가정에서 관심 물체를 검색하는” 데 유용하지만, 언어 임베딩 3D의 기준 방법인 LERF는 모든 포즈가 사전에 알려진 오프라인 장면별 NeRF 최적화를 필요로 합니다(모든 이미지에 대해 장면 특화 오토인코더를 먼저 학습해야 하는 LangSplat도 마찬가지입니다). 로봇에게는 정반대의 작업 흐름이 필요합니다: 이전에 보지 못한 환경(이 논문에서는 750 sq ft 이상)을 이동하는 동안 의미론적 지도를 구축해야 하며, 카메라가 선반과 벽에 거의 평행하게 움직이는 제약된 궤적에서, 누적되는 포즈 드리프트와 함께, 즉시 질의에 응답해야 합니다. 포인트 클라우드 접근법(ConceptFusion, CLIP-Fields)은 포인트당 하나의 특징을 융합하여, LERF의 스케일 조건화 필드가 제공하는 객체-대-부분의 다중 스케일 추론 능력을 잃습니다.
방법 및 아키텍처
전방을 향하는 RGB-D Realsense D455와 측면을 향하는 두 대의 ZED 2 스테레오 카메라(알려진 외부 파라미터)를 갖춘 Fetch 로봇; 처리는 두 개의 RTX 4090을 가진 데스크톱으로 스트리밍됩니다(하나는 LEGS 학습용, 약 15 GB; 하나는 DROID-SLAM용, 최대 18 GB):
- 다중 카메라 복원: 오프라인 SfM은 거의 겹치지 않는 측면 카메라를 등록하지 못하므로, DROID-SLAM이 하나의 측면 ZED 스트림을 온라인으로 추적하고 마운트의 CAD 외부 파라미터가 나머지 두 카메라의 포즈를 외삽합니다 — 유효 시야각을 공짜로 세 배로 늘립니다. 추적은 30 fps로 실행됩니다.
- 점진적 3DGS 구축: Nerfstudio의 Splatfacto가 이미지-포즈 쌍의 스트림을 소비하도록 수정됩니다. 새로운 가우시안은 깊이 영상의 픽셀 500개를 샘플링하고, (얇거나 투명한 물체에도 정확한) 학습된 스테레오 모델의 메트릭 깊이로 역투영하여 키프레임마다 초기화됩니다.
- 루프 내 전역 번들 조정: 키프레임 150개마다, DROID-SLAM의 전역 BA가 키프레임 그래프 전체에 걸쳐 모든 과거 포즈를 재최적화하고(재투영된 포인트와 갱신된 optical-flow 대응점 간 마할라노비스 거리 최소화), 3DGS 학습 카메라도 그에 따라 갱신됩니다 — 그렇지 않으면 발생하는 중복 객체, 흐릿한 기하, 고스팅을 완화합니다. (SplaTAM처럼 스플랫 내부에서 포즈를 추적하는 것은 프레임당 최대 1초가 걸려 여기서는 너무 느립니다.)
- 언어 임베딩(하이브리드 명시적-암묵적): 기하는 명시적 가우시안이고, 의미론은 스케일 조건화된 필드 에 존재합니다 — 위치 는 다중 해상도 해시 인코딩을 거쳐 를 만들고, 이어서 MLP 가 차원 언어 특징을 출력합니다. 특징은 타일 기반 래스터라이저로 특징 영상에 래스터화되어, (스케일 전체를 평균화하는 FMGS와 달리, LERF처럼) 학습 이미지의 다중 스케일 CLIP 크롭에 대해 지도됩니다. 추론은 1080p에서 약 50 Hz로 실행됩니다.
- 질의: 텍스트 프롬프트가 CLIP으로 인코딩되고, LERF 스타일의 관련성 맵이 계산되며, 질의는 3D 가우시안 평균 위에서 관련성이 최대인 지점으로 세계 좌표계에서 위치가 정해집니다 — 밀집 포인트 클라우드의 체적 렌더링이 필요 없습니다.
실험 결과
- 객체 재현율(4개 장면; 각각 GPT-4V가 생성한 개방형 어휘 질의 15개; 최상위 관련성 포인트가 새로운 뷰에서 수동 주석된 박스 안에 투영되면 성공): LEGS 대 LERF — Office Kitchen 10/15 대 9/15, Office Dining Area 11/15 대 11/15, Office Workspace 9/15 대 10/15, Grocery Store Testbed 10/15 대 12/15 — 비슷한 성공률, 개방형 어휘 및 롱테일 질의에서 “최대 66% 정확도”.
- 학습 시간(평균 PSNR 20까지): LEGS 12분 대 LERF 44분 — 3.5배 이상 빠르며, LEGS는 포즈를 점진적으로 받는 반면 LERF는 최종 포즈를 받습니다.
- 번들 조정 ablation(학습 뷰 PSNR, BA 없음 → BA 있음): D435 18.6 → 22.7, D455 20.0 → 23.5, ZED 2 19.2 → 23.8 — BA는 모든 카메라에서 고스트 중복(예: 두 개로 겹친 배구공)을 제거합니다.
- 다중 카메라 대 단일 카메라: 3대 카메라 리그는 단일 ZED가 놓치는 낮은 시야 물체(쓰레기 활송장치, 바닥 주의 표지판)를 복원합니다.
- 언급된 실패 모드: 학습 뷰에서 작거나 먼 물체, 물체-배경 색상 유사성, 의미론적으로 유사한 물체에서의 거짓 양성, 정적 장면 가정.
SLAM에서의 의미
LEGS는 “기하학으로서의 SLAM”에서 Spatial AI로 나아가는 구체적인 한 걸음입니다: 로봇이 매장이나 창고를 매핑하면서 즉시 “구급상자가 어디 있어?”라는 질문을 받을 수 있습니다. 온라인 3DGS 학습을 언어 정렬 특징 지도와 결합한 최초의 시스템 중 하나로, LERF의 아이디어가 캡처-후-최적화 방식에서 점진적 로봇 매핑으로 옮겨가도 살아남는다는 것을 보였습니다 — 고전적 SLAM 기법(DROID-SLAM 추적 + 주기적 전역 BA)이 방 규모에서 온라인 스플랫 학습을 가능케 하는 포즈 일관성을 공급합니다.