Kimera-Multi

Tian 2022 · 논문

한 줄 요약 — Kimera-Multi는 루프 클로저 이상값에 강인하면서, 오직 피어-투-피어 통신만으로 완전히 분산되어 있으며, 전역적으로 일관된 메트릭-시맨틱 3D 메쉬를 실시간으로 구축할 수 있는 최초의 멀티로봇 시스템이다.

문제

이전의 협업 SLAM 시스템들은 중앙 서버에 의존하거나 시맨틱 콘텐츠가 전혀 없는 순수 기하학적 맵을 생성했으며, 이들 모두 지각 앨리어싱에 노출되어 있었다: 시각적으로 비슷한 장소들이 공동 추정값을 손상시킬 수 있는 잘못된 로봇 간 및 로봇 내부 루프 클로저를 생성한다. 기존의 강인한 기법들은 초기화에 지나치게 의존하거나, (PCM의 최대 클리크처럼) 재현율이 낮은 휴리스틱 탐색을 사용한다. Kimera-Multi는 링크가 사용 가능할 때만 이웃과 통신하는 로봇 팀이, 허위 루프 클로저를 식별하고 제거하면서 전역적으로 일관된 시맨틱 3D 메쉬를 실시간으로 구축할 수 있는지를 묻는다.

방법 및 아키텍처

로봇별 프론트엔드. 각 로봇은 Kimera를 실행한다: 시각-관성 오도메트리를 위한 Kimera-VIO와, 면(face)에 시맨틱 레이블을 담는 로컬 3D 메쉬. 로봇들이 통신 범위 안에 들어오면 분산 장소 인식이 bag-of-words 벡터를 교환한다. 매칭이 발견되면 기하학적 검증이 트리거되고, 이는 키포인트와 특징 디스크립터를 전송해 잠재적 로봇 간 루프 클로저를 계산한다.

1단계 — 강인한 초기화. 로봇 α\alpha의 포즈 ii(프레임 AA)와 로봇 β\beta의 포즈 jj 사이의 루프 클로저는 다음의 후보 프레임 정렬을 산출한다

X^BijAX^αiAX~βjαi(X^βjB)1,\widehat{X}^{A}_{B_{ij}} \triangleq \widehat{X}^{A}_{\alpha_i}\, \widetilde{X}^{\alpha_i}_{\beta_j}\, \big(\widehat{X}^{B}_{\beta_j}\big)^{-1},

여기서 X^\widehat{X}는 오도메트리 포즈 추정값이고 X~βjαi\widetilde{X}^{\alpha_i}_{\beta_j}는 측정된 루프 클로저이다. 인라이어 정렬은 서로 일치하므로, 상대 프레임 변환은 강인한 포즈 평균화로 찾는다, X^BAargminXSE(3)(i,j)Lα,βρ(rij(X))\widehat{X}^{A}_{B} \in \arg\min_{X \in \mathrm{SE}(3)} \sum_{(i,j) \in L_{\alpha,\beta}} \rho(r_{ij}(X)), 여기서 ρ\rho는 truncated least squares(TLS) 비용이며 GNC(GTSAM)로 로컬에서 풀린다. 로봇 수준 종속성 그래프의 스패닝 트리가 한 로봇의 프레임을 팀 전체로 전파한다.

2단계 — 분산형 graduated non-convexity(D-GNC). 모든 궤적은 오도메트리(2차)와 루프 클로저(TLS)에 대한 강인한 PGO로 정제되며, 잔차는 코달(chordal) 거리로 측정된다. GNC는 Black–Rangarajan 쌍대성을 사용해 강인 추정을 다음으로 재작성한다

minxX,wi[0,1]  i[wiri2(x)+Φρμ(wi)],\min_{x\in\mathcal{X},\, w_i\in[0,1]}\; \sum_i \big[\, w_i\, r_i^2(x) + \Phi_{\rho_\mu}(w_i) \,\big],

여기서 wiw_i는 측정값별 신뢰 가중치, Φρμ\Phi_{\rho_\mu}는 이상값 프로세스 페널티, 그리고 제어 파라미터 μ\mu는 대체 비용을 볼록에서 실제 TLS 비용을 향해 어닐링한다. D-GNC는 완전히 분산된 두 단계를 교대로 실행한다: (i) 변수 갱신 — 순위 제한 완화(기본값 랭크 5, 갱신당 15회 반복)에 대해 Riemannian block-coordinate descent(RBCD) 솔버로 가중 PGO를 풀며, 각 로봇은 자신의 궤적만 갱신하고 이웃과는 “공개 포즈”만 교환한다; 그리고 (ii) 가중치 갱신 — 루프 클로저별로 독립적으로 계산되는 TLS 닫힌 형식:

wi{0,r^i2[μ+1μcˉ2,+],cˉr^iμ(μ+1)μ,r^i2[μμ+1cˉ2,μ+1μcˉ2],1,r^i2[0,μμ+1cˉ2],w_i \leftarrow \begin{cases} 0, & \widehat{r}_i^{\,2} \in \big[\tfrac{\mu+1}{\mu}\bar{c}^2,\, +\infty\big], \\ \frac{\bar{c}}{\widehat{r}_i}\sqrt{\mu(\mu+1)} - \mu, & \widehat{r}_i^{\,2} \in \big[\tfrac{\mu}{\mu+1}\bar{c}^2,\, \tfrac{\mu+1}{\mu}\bar{c}^2\big], \\ 1, & \widehat{r}_i^{\,2} \in \big[0,\, \tfrac{\mu}{\mu+1}\bar{c}^2\big], \end{cases}

여기서 r^i\widehat{r}_i는 현재 잔차, cˉ\bar{c}는 TLS 임계값이다 — μ\mu가 어닐링됨에 따라 이상값 가중치는 0으로 몰린다. 마지막으로 각 로봇은 메쉬 변형으로 로컬 시맨틱 메쉬를 보정하여, 재구성이 최적화된 궤적과 일치하도록 유지한다.

실험 결과

SLAM에서의 의미

Kimera-Multi는 MIT SPARK Kimera 생태계를 로봇 팀으로 확장한 대표작으로, 현대 분산 SLAM 시스템이 갖춰야 할 표준을 세웠다: 강인성(DOOR-SLAM의 PCM이 연 길을 이어가는 GNC 이상값 제거), 중앙집중식 수준의 정확도를 갖춘 분산화, 그리고 다운스트림 계획에 사용 가능한 시맨틱하게 의미 있는 밀집 맵. 그 메트릭-시맨틱 메쉬 출력은 장면 그래프 계열 연구(Kimera, Hydra, Hydra-Multi)에도 공급된다. 오늘날 시맨틱을 갖춘 멀티로봇 매핑이 필요하다면 이것이 정전(canonical)적인 참조 시스템이다.

관련 문서