DXSLAM

Li 2020 · 논문

한 줄 요약 — ORB-SLAM2 파이프라인 안에서 수작업으로 설계된 ORB 특징점을 HF-Net의 딥러닝 기반 지역/전역 특징으로 교체하여, 조명 변화와 라이프롱(lifelong) SLAM 환경의 장면 변화에 대한 강건성을 크게 향상시켰습니다 — 그러면서도 CPU에서 실시간으로 동작합니다.

문제

시각 SLAM에서 “대부분의 측면에서 이론적 프레임워크가 잘 확립되어 있지만, 특징점 추출과 데이터 연관(feature extraction and association)은 여전히 대부분의 경우 경험적으로 설계되어 복잡한 환경에서 취약할 수 있습니다” — ORB-SLAM2는 장면이나 시점이 바뀌면 이전에 방문한 장소를 인식하지 못하는 경우가 자주 발생합니다. CNN 특징은 훨씬 더 강건하지만, 대부분의 딥러닝 특징 기반 시스템은 GPU를 필요로 하며, 이는 많은 로봇에서 비현실적입니다. DXSLAM은 딥러닝 특징이 “현대적인 SLAM 프레임워크에 자연스럽게 통합될 수 있음”을 보이고 이를 CPU 실시간으로 구현했습니다: 특징점만 바꾸고 검증된 기하학적 백엔드는 그대로 유지하는 것입니다.

방법 및 아키텍처

전체 프레임워크는 ORB-SLAM2의 추적(tracking) / 지역 매핑(local mapping) / 루프 클로징(loop closing) 파이프라인이며, 특징 추출, 재지역화, 루프 클로저가 하나의 CNN을 중심으로 재구성되어 있습니다.

s(v1,v2)=i=1Nv1,i+v2,iv1,iv2,i,s(v_{1},v_{2})=\sum_{i=1}^{N}|v_{1,i}|+|v_{2,i}|-|v_{1,i}-v_{2,i}|,

로 순위화합니다. BoW는 공간적 관계를 버리기 때문에, 두 번째 단계에서는 각 후보에 대해 전역 디스크립터 내적 거리를 계산하고 임계값 이하인 가장 근접한 후보만 수용합니다 — 잘못된 루프 클로저는 지도를 손상시키므로 정밀도를 우선시하는 방식입니다.

실험 결과

OpenLORIS-Scene 재지역화 테스트(오피스 장면, 통제된 난이도 요인)에서 DXSLAM은 조명 변화 조건에서 0.862점을 기록했습니다(ORB-SLAM2: 0.764). 저조도 조건에서는 0.994점을 기록했습니다(ORB-SLAM2와 DS-SLAM은 0). 물체와 사람이 바뀐 조건에서는 0.999점을 기록했습니다. 다만 완전한 시점 반전에서는 모든 방법이 실패합니다(0). New College와 City Center에서의 루프 클로저 PR 곡선을 보면, 전체 방법(HF-FBoW-GLB)이 ORB-SLAM2의 ORB-BoW보다 확실히 우수하며, 전역 디스크립터 단계가 상당한 마진을 추가합니다. TUM RGB-D 동적 시퀀스에서 ATE RMSE는 fr3_walking_static에서 0.3900 m(ORB-SLAM2)에서 0.0167 m로, fr3_walking_half에서 0.4863 m에서 0.0759 m로 감소하며, 이는 동적 상황을 명시적으로 처리하지 않는데도 동적 인식 시스템인 DS-SLAM과 비교할 만한 수준입니다. 15 W급 i7-10710U에서의 특징 추출은 OpenVINO를 사용할 경우 이미지당 46.2 ms가 걸립니다(순수 HF-Net의 144.2 ms보다 68% 빠름; SuperPoint는 387.5 ms, D2-Net은 2484.6 ms가 필요). 전체 ROS 시스템은 Intel NUC에서 초당 약 15 Hz로 포즈를 발행합니다.

SLAM에서의 의미

DXSLAM은 고전적 SLAM을 현대화하는 가장 단순한 방법을 명료하게 보여줍니다: 검증된 기하학적 백엔드는 유지한 채 학습된 특징점만 교체하는 것입니다. 이 방법은 시스템을 재설계하지 않고도 동적 환경과 라이프롱 SLAM 환경에서 ORB-SLAM2보다 상당한 강건성 향상을 보였고, 특이하게도 이 방식이 GPU가 없는 로봇에서도 배포 가능함을 입증했습니다. DXSLAM은 3단계(Level 3)의 고전적 시스템과 5단계(Level 5)의 학습된 특징 연구(SuperPoint, HF-Net)를 잇는 가교 역할을 하며, 많은 실제 시스템이 정확히 이러한 하이브리드 방식을 따르고 있습니다.

관련 문서