DynaSLAM

Bescós 2018 · 논문

한 줄 요약 — ORB-SLAM2 위에 Mask R-CNN 기반의 동적 물체 제거와 배경 인페인팅(inpainting)을 추가하여, 움직이는 물체가 있는 장면에서도 추적과 매핑이 강건하게 동작하도록 만들었습니다(단안, 스테레오, RGB-D 모두 지원).

문제

“장면 강체성(scene rigidity) 가정은 SLAM 알고리즘에서 흔히 쓰입니다. 이러한 강한 가정은 서비스 로봇이나 자율주행 차량처럼 여러 중요한 응용의 대상이 되는, 사람이 붐비는 실제 환경에서 대부분의 시각 SLAM 시스템의 사용을 제한합니다.” 움직이는 사람과 차량 위의 특징점은 포즈 추정을 왜곡하고, 지도에 새겨진 동적 콘텐츠는 오래된 랜드마크와 잘못된 루프 클로저 후보를 만들어냅니다. DynaSLAM은 ORB-SLAM2에 두 가지 기능을 추가합니다: (다중 뷰 기하학, 딥러닝, 또는 둘 다에 의한) 동적 물체 검출과 배경 인페인팅으로, 지도가 오직 영속적인 장면만을 담도록 합니다.

방법 및 아키텍처

Δz=zprojz>τz,τz=0.4 m,\Delta z = z_{proj} - z' > \tau_z, \qquad \tau_z = 0.4\ \text{m},

이를 만족하면 해당 점은 동적인 것으로 표시됩니다. τz\tau_z는 30개의 손으로 레이블링된 TUM 이미지에서 0.7×Precision+0.3×Recall0.7 \times \text{Precision} + 0.3 \times \text{Recall}을 최대화하도록 튜닝되었습니다. 동적 레이블은 깊이 패치 분산을 통해 정제된 뒤, 깊이 이미지에서의 영역 성장(region growing)을 통해 전체 마스크로 확장됩니다.

실험 결과

SLAM에서의 의미

DynaSLAM은 DS-SLAM과 함께, 이후 거의 모든 동적 환경 SLAM 논문이 TUM RGB-D 동적 시퀀스에서 비교 대상으로 삼는 표준적인 동적 SLAM 베이스라인입니다. 학습된 인스턴스 세그멘테이션과 기하학적 일관성 검사를 결합하는, 지금은 표준이 된 방식을 확립했으며, “제거하고 인페인팅한다”는 발상은 지도가 일시적으로 존재하는 개체가 아니라 영속적인 장면을 나타내야 하는 라이프롱 매핑을 가리켰습니다. DynaSLAM II는 이후 동적 물체를 버리는 방식에서 그것을 추적하는 방식으로 발전했습니다.

관련 문서