LEGS

Yu 2024 · 논문

한 줄 요약 — Language-Embedded Gaussian Splats: 모바일 로봇이 주행하면서 스케일 조건화된 CLIP 특징 필드를 갖춘 방 규모의 3DGS 지도를 온라인으로 점진적으로 구축하여, LERF의 개방형 어휘 질의 성공률에 맞먹으면서 3.5배 빠르게 학습합니다.

문제

의미론적 3D 지도는 “사무실, 창고, 매장, 가정에서 관심 물체를 검색하는” 데 유용하지만, 언어 임베딩 3D의 기준 방법인 LERF는 모든 포즈가 사전에 알려진 오프라인 장면별 NeRF 최적화를 필요로 합니다(모든 이미지에 대해 장면 특화 오토인코더를 먼저 학습해야 하는 LangSplat도 마찬가지입니다). 로봇에게는 정반대의 작업 흐름이 필요합니다: 이전에 보지 못한 환경(이 논문에서는 750 sq ft 이상)을 이동하는 동안 의미론적 지도를 구축해야 하며, 카메라가 선반과 벽에 거의 평행하게 움직이는 제약된 궤적에서, 누적되는 포즈 드리프트와 함께, 즉시 질의에 응답해야 합니다. 포인트 클라우드 접근법(ConceptFusion, CLIP-Fields)은 포인트당 하나의 특징을 융합하여, LERF의 스케일 조건화 필드가 제공하는 객체-대-부분의 다중 스케일 추론 능력을 잃습니다.

방법 및 아키텍처

전방을 향하는 RGB-D Realsense D455와 측면을 향하는 두 대의 ZED 2 스테레오 카메라(알려진 외부 파라미터)를 갖춘 Fetch 로봇; 처리는 두 개의 RTX 4090을 가진 데스크톱으로 스트리밍됩니다(하나는 LEGS 학습용, 약 15 GB; 하나는 DROID-SLAM용, 최대 18 GB):

실험 결과

SLAM에서의 의미

LEGS는 “기하학으로서의 SLAM”에서 Spatial AI로 나아가는 구체적인 한 걸음입니다: 로봇이 매장이나 창고를 매핑하면서 즉시 “구급상자가 어디 있어?”라는 질문을 받을 수 있습니다. 온라인 3DGS 학습을 언어 정렬 특징 지도와 결합한 최초의 시스템 중 하나로, LERF의 아이디어가 캡처-후-최적화 방식에서 점진적 로봇 매핑으로 옮겨가도 살아남는다는 것을 보였습니다 — 고전적 SLAM 기법(DROID-SLAM 추적 + 주기적 전역 BA)이 방 규모에서 온라인 스플랫 학습을 가능케 하는 포즈 일관성을 공급합니다.

관련 문서