OKVIS2-X

Boche & Leutenegger 2025 · 논문

한 줄 요약 — OKVIS2-X는 OKVIS2를 시각, 관성, 측정 또는 학습된 깊이, LiDAR, GNSS 측정값을 융합하는 통합 다중 센서 SLAM 시스템으로 확장하는 동시에, 추정기에 긴밀하게 결합된 조밀한 볼류메트릭 점유 서브맵을 구축하여 9,km 시퀀스까지 실시간으로 확장됩니다.

문제

대부분의 최신 VI-SLAM 시스템은 다운스트림 작업에 필요한 기하학적 세부 정보가 부족한 희소 랜드마크 지도만 구축합니다(경로 계획에는 명시적인 자유 공간이 필요하지만, 포인트 클라우드와 메시는 이를 표현하지 못합니다), 그리고 각 시스템은 일반적으로 하나의 고정된 센서 구성을 중심으로 구축됩니다. 카메라, IMU, 깊이/LiDAR, GNSS 수신기를 탑재한 로봇은 전통적으로 별도의 VIO, LiDAR-관성, 지도 제작 스택을 함께 엮어야 했습니다. OKVIS2-X는 이 모든 것을 한 번에 요구합니다: 최고의 정확도와 강건성, 조밀하고 전역적으로 일관된 볼류메트릭 점유 지도, 대규모 운용, 그리고 실시간 성능—단일 설정 가능한 팩터 그래프 프레임워크 안에서.

방법 및 아키텍처

OKVIS2-X는 OKVIS2의 프론트엔드(BRISK 키포인트, DBoW2 장소 인식, 선택적 Fast-SCNN 하늘 세그멘테이션), 실시간 추정기, 비동기 루프 최적화를 유지하면서, 세 개의 모듈을 추가합니다: 깊이 네트워크, 다중 센서 프로세서(GNSS 잔차, LiDAR 모션 왜곡 보정, 프레임-대-지도 팩터), 서브맵 인터페이스입니다. 모든 것은 하나의 목적 함수로 결합됩니다:

c(x)=12i,k,jρc(eri,j,kTWreri,j,k)+12keskTWskesk+12r,cepr,cTWpr,cepr,c+12ρt(em2)+12jGegjTWgjegj,c(\mathbf{x}) = \frac{1}{2}\sum_{i,k,j} \rho_{\mathrm{c}}\left({\mathbf{e}_{\mathrm{r}}^{i,j,k}}^T \mathbf{W}_{\mathrm{r}} \mathbf{e}_{\mathrm{r}}^{i,j,k}\right) + \frac{1}{2}\sum_{k} {\mathbf{e}_{\mathrm{s}}^{k}}^T \mathbf{W}_{\mathrm{s}}^{k} \mathbf{e}_{\mathrm{s}}^{k} + \frac{1}{2}\sum_{r,c} {\mathbf{e}_{\mathrm{p}}^{r,c}}^T \mathbf{W}_{\mathrm{p}}^{r,c} \mathbf{e}_{\mathrm{p}}^{r,c} + \frac{1}{2}\sum \rho_{\mathrm{t}}\left(e_{\mathrm{m}}^2\right) + \frac{1}{2}\sum_{j\in\mathcal{G}} {\mathbf{e}_{\mathrm{g}}^{j}}^T \mathbf{W}_{\mathrm{g}}^{j} \mathbf{e}_{\mathrm{g}}^{j},

즉 재투영, 사전 적분된 IMU, 주변화에서 유래한 포즈 그래프, 지도 정렬(프레임-대-지도 및 지도-대-지도), GNSS 팩터로 구성되며, Cauchy(ρc\rho_{\mathrm{c}})와 Tukey(ρt\rho_{\mathrm{t}}) 강건화기를 사용합니다.

실험 결과

SLAM에서의 의미

OKVIS2-X는 오픈소스 다중 센서 SLAM의 현재 최전선을 나타냅니다: OKVIS/OKVIS2가 개척한 슬라이딩 윈도우 + 포즈 그래프 아키텍처는 카메라-IMU 쌍에서 전체 센서 구성으로 깔끔하게 일반화되며, 조밀한 점유 지도 제작은 소극적인 부산물에서 궤적을 개선하는 일급 팩터로 승격됩니다. 실무자에게는 이전에는 별도의 VIO, LiDAR-관성, 지도 제작 스택을 엮어야 했던 사용 사례들을 다루는 단일 설정 가능한 시스템입니다(vi / vid / vil / vig / vidg / vilg)—그리고 그 지도는 자유 공간을 명시적으로 표현하며, 안전한 주행에 직접 사용할 수 있습니다.

관련 문서