MID-Fusion

Xu 2019 · 논문

한 줄 요약 — 각 객체마다 별도의 체적(TSDF) 모델을 구축하면서 장면 내 움직임에 강건함을 유지하는, 옥트리 기반의 객체 수준·다중 인스턴스 동적 RGB-D SLAM 시스템.

문제

정적 세계를 가정한 SLAM은 움직이는 객체를 이상값으로 취급하므로, 동적 환경에서는 추적을 잃거나 맵이 손상된다 — 그리고 살아남더라도 맵에는 로봇이 행동에 옮길 수 있는 객체별 정보가 전혀 없다. MaskFusion과 Co-Fusion은 서펠 기반 객체 수준 동적 SLAM을 보여주었지만, 서펠 클라우드는 로봇 작업에 필요한 자유 공간이나 표면 연결성을 직접 표현할 수 없다. MID-Fusion은 체적 객체 수준 동적 SLAM을 목표로 한다: 동적 장면에서 강건한 카메라 추적을 수행하면서, 임의의 객체에 대해 기하학적, 의미론적, 운동 속성을 지속적으로 추정하는 것이다.

방법 및 아키텍처

파이프라인은 분할, 추적, 융합, 레이캐스팅의 네 부분으로 구성된다. 탐지된 각 객체 n{0..N}n \in \{0..N\} (0 = 배경)은 자신만의 좌표계에서 옥트리 기반 TSDF 볼륨(Supereight 위에 구축)을 가지며, 이 복셀에는 SDF, 명도, 전경 확률과 가중치, 그리고 COCO 클래스 분포, 포즈 TWOnT_{WO_n}, 이동/정지 플래그가 저장된다.

카메라 추적. 라이브 포즈 TWCLT_{WC_L}은 (사람을 제외한) 유효 픽셀에 대한 결합 밀도 잔차를 최소화한다.

Etrack(TWCL)=12(uLMLwgρ(eg)+uRMRwpρ(ep)),E_{\mathrm{track}}(T_{WC_L}) = \tfrac{1}{2}\Big(\sum_{\mathbf{u}_L \in M_L} w_{\mathrm{g}}\,\rho(e_{\mathrm{g}}) + \sum_{\mathbf{u}_R \in M_R} w_{\mathrm{p}}\,\rho(e_{\mathrm{p}})\Big),

여기서 ρ\rho는 Cauchy 손실, ege_{\mathrm{g}}는 라이브 정점 맵과 모델이 렌더링한 정점/법선 맵 사이의 점-대-평면 ICP 잔차, epe_{\mathrm{p}}렌더링된(잡음 제거된) 모델 깊이에 대해 평가된 광도 잔차이다. 잔차는 측정 불확실성으로 가중된다: RGB에는 상수, ICP에는 wg=1/(nrnrσDσD)w_{\mathrm{g}} = 1/(\mathbf{n}^{r\top}\mathbf{n}^{r}\,\sigma_D^{\top}\sigma_D)이며 센서 모델 σD=(Dfσxy, Dfσxy, D2fbσz)\sigma_D = \big(\tfrac{D}{f}\sigma_{xy},\ \tfrac{D}{f}\sigma_{xy},\ \tfrac{D^2}{fb}\sigma_z\big) (ff는 초점 거리, bb는 기저선)을 사용한다. Gauss–Newton, 3단계 거친-세밀. 추적은 프레임마다 두 번 실행된다: 먼저 사람을 뺀 모든 모델 정점에 대해, 그 다음 — 레이캐스팅이 가시 객체를 드러내고 잔차 검사가 움직이는 것을 표시한 후(객체가 렌더링된 마스크 내에서 인라이어 비율이 0.9 미만으로 떨어지면 움직이는 것으로 간주) — 정적인 부분만으로 정제된다.

객체 포즈 추정. 움직이는 객체는 동일한 가중 ICP + RGB 비용으로 추적되지만 객체 좌표계로 재파라미터화되어, “가상 카메라” 대신 TCLOLT_{C_LO_L}을 직접 추정한다. 회전 야코비안은 그때 CCLOL1(vLrCLOL)C_{C_LO_L}^{-1}(\mathbf{v}_L - \mathbf{r}_{C_LO_L})에 비례하며, 이는 객체 좌표계가 객체를 중심으로 하기 때문에 작다 — 지레 팔이 짧아져 큰 객체 회전 아래에서도 더 안정적으로 수렴한다.

분할. Mask R-CNN 마스크는 기하학적 에지로 정제되고, 렌더링된 마스크의 IoU로 기존 모델에 연관되며(0.5 초과 시 수락; 레이블이 맵 안에서 확률적으로 정제되므로 클래스 일치 요구 사항은 없음), 이후 운동 잔차로 필터링된다 — 결합 ICP+RGB 잔차가 큰 픽셀은 이상값으로 처리된다. 전경 확률(마스크 내부는 1, 확장된 배경은 0, Mask R-CNN이 놓친 객체는 0.5)이 나쁜 마스크로부터 융합을 보호한다.

융합. 깊이, 색상, 전경 확률, 의미론적 분포가 각 객체의 옥트리 TSDF에 통합된다(의미론은 베이지안 갱신이 아니라 평균화로 처리되는데, 베이지안 갱신은 Mask R-CNN 예측에 과도하게 의존하기 때문이다). 새 객체는 뒤로 투영된 포인트 클라우드 크기의 3배 볼륨, 약 1mm 복셀 해상도로 초기화된다 — 사용되지 않는 옥트리 복셀은 결코 할당되지 않기 때문에 감당할 수 있는 비용이다.

실험 결과

SLAM에서의 의미

MaskFusion과 함께 MID-Fusion은 객체 수준 동적 SLAM을 정의했다: 개별적으로 추적되고 재구성된 객체 인스턴스로 구성된 맵이다. 체적 방식의 선택이 중요한데 — 객체별로 물이 새지 않는 TSDF는 서펠 클라우드가 할 수 없는 방식으로 파지 계획, 충돌 검사, 자유 공간 추론을 지원하며 — 그 객체 중심 추적 파라미터화와 불확실성 가중 잔차는 표준적인 기법이 되었다. 이는 동적 SLAM이 움직임에서 살아남는 것에서 그것을 모델링하는 것으로 옮겨간 지점을 나타낸다.

관련 문서