CubeSLAM
Yang 2019 · 논문
한 줄 요약 — 3D 직육면체(cuboid) 물체 랜드마크를 단안 SLAM에 도입하여, 드리프트를 줄이는 장거리 기하학적/스케일 제약을 제공하는 동시에, 동적 물체를 거부하는 대신 모델링한다.
문제
단안 SLAM은 스케일 모호성과 긴 궤적에 걸친 드리프트 누적을 겪으며, 대부분의 시스템은 정적 장면을 가정하고 동적 영역의 특징점을 이상값으로 취급한다. 한편 단안 3D 물체 감지는 하나의 뷰만으로는 물체 포즈가 충분히 제약되지 않고, 대부분의 방법이 사전 CAD/형상 모델을 필요로 하기 때문에 어렵다. CubeSLAM의 관찰은 이 두 문제가 서로를 풀어준다는 것이다: 물체는 점이 갖지 못한 스케일과 장거리 제약을 담고 있고, SLAM의 다중 뷰 일관성은 단일 뷰 감지를 개선하며, 움직이는 물체는 버리는 대신 모델링될 수 있다 — 논문은 “두 부분이 서로를 개선할 수 있음”을 보인다.
방법 및 아키텍처
ORB-SLAM2 위에 구축되었다(추적과 키프레임 생성은 변경되지 않음); 각 새 키프레임은 직육면체 감지, 물체 연관, 그리고 카메라·물체·점에 대한 BA를 거친다.
단일 이미지 직육면체 감지. 직육면체는 위치 , 회전 , 크기 의 9 자유도(DoF)를 가진다. 2D 경계 상자는 4개의 제약만 주므로, 소실점(vanishing point)을 샘플링하여 제안을 생성한다 — — 여기에 상단 코너 하나를 더하며; 나머지 7개 코너는 선의 교차로부터 얻어진다. 지면 위 물체의 경우, 지면 코너 픽셀 는 지면 평면 위로 해석적으로 역투영된다:
스케일은 카메라 높이로 고정된다. 제안들은 로 점수가 매겨진다 — 직육면체 에지와 Canny 에지 간의 챔퍼 거리(Chamfer distance), 긴 선분과 소실점의 정렬, 그리고 왜곡 비율 페널티(, )이다.
물체 BA. 카메라 , 직육면체 , 점 가 있을 때, BA는 다음을 최소화한다
- 카메라-물체, 3D 형태: (앞뒤를 구분할 수 없으므로 의 요(yaw) 반전에 대해 검사됨); 2D 형태: 여덟 개의 코너를 투영하여 경계 사각형의 중심/크기 를 얻어 비교, — 정보량은 적지만 불확실성이 훨씬 낮다.
- 물체-점: 물체 위의 점들은 그 안에 있어야 한다, .
- 카메라-점: 표준 재투영 .
연관(association)은 공유 특징점(10개 이상의 공유 점, 직육면체 중심으로부터 1 m 이내의 점)을 통해 프레임 간 물체를 매칭한다 — 폐색과 반복된 물체에 강건하다. 직육면체는 또한 삼각측량하기 어려운 점들의 깊이를 초기화한다.
동적 물체. 단단하게 움직이는 물체는 자신의 점들을 물체 프레임에 고정하며; 비홀로노믹 바퀴 모델은 를 예측하여 운동 모델 오차 를 주고, 동적 점들은 재투영 항 을 추가하므로, 움직이는 차량이 카메라를 제약한다. 동적 점은 KLT로 추적되며 운동 보정된 투영 행렬로 삼각측량된다.
실험 결과
- 단일 뷰 감지: SUN RGB-D 부분집합에서 3D IoU 0.39로, SUN Primitive의 0.36과 대비된다(감지된 이미지에서는 3dgp의 0.42 대 0.45); 약 50개의 제안으로 약 90%의 3D 제안 재현율, 2D IoU 0.6 기준. KITTI에서는 단 20개의 점수화된 제안으로 90%의 재현율을 달성한다(Mono3D는 약 14,000개의 샘플이 필요); 상위 10개 제안은 IoU 0.38 / AP 0.75에 도달한다.
- 물체 SLAM의 상호 이득: 질감이 적은 TUM fr3_cabinet(기존 단안 SLAM 모두 실패)에서, 물체 전용 SLAM은 포즈 오차 0.17 m를 달성하며 BA 후 물체 IoU를 0.46에서 0.64로 끌어올린다. 10개의 KITTI 원본 시퀀스에서 평균 물체 IoU는 0.42 → 0.47로 상승하고 병진 오차는 4.95%(루프 클로저 없는 ORB)에서 1.62%로 떨어진다.
- KITTI 오도메트리 벤치마크: 물체 기반 CubeSLAM은 평균 병진 오차 2.74%를 달성하며, 이는 기존 물체 기반 스케일 보정(Frost et al.)의 9.75%와 대비된다; 지면 평면 스케일링과 결합하면 1.78%에 도달한다 — 루프 클로저나 고정된 카메라 높이 가정 없이, 당시 최고 수준의 단안 정확도이다.
- 동적 KITTI 시퀀스: 카메라 병진 오차 3.42로, 4.96(루프 클로저 없는 ORB)의 평균과 대비된다; 동적 물체 3D IoU 0.32 → 0.39; 이동 차량 깊이 추정 오차는 평균 4.9%로, 기존 스테레오 기반 추적기의 6.8%/7.9%와 대비된다; 속도 추정치는 구간별 등속 운동 가정 하에 실측값을 잘 추적한다.
SLAM에서의 의미
CubeSLAM은 사전 물체 모델 없이 물체 수준 단안 SLAM을 개척했으며, 의미론적 물체 감지와 기하학적 SLAM이 상호 이득을 준다는 것을 보였다: SLAM의 다중 뷰 일관성이 3D 물체 감지를 개선하고, 물체가 SLAM의 드리프트와 스케일 오차를 줄인다. 동적 물체를 일급 시민(first-class citizen)으로 다룬 이 접근은 DynaSLAM II, VDO-SLAM과 같은 이후의 동적 SLAM 시스템을 예고했으며, 그 직육면체 표현은 QuadricSLAM의 타원체(ellipsoid)와 더불어 물체-랜드마크 연구 방향을 정의했다.