MoreFusion
Wada 2020 · 논문
한 줄 요약 — RGB-D 비디오를 객체별 점유 볼륨으로 융합하고, 미분 가능한 충돌 검사를 사용해 이미 알고 있는 여러 객체의 6D 포즈를 공동으로 정제함으로써, 접촉 중이거나 가려진 객체에 대해서도 정확한 포즈 추정을 가능하게 함.
문제
단일 RGB-D 이미지로부터의 6D 객체 포즈 추정은 가림과 모호성에 의해 근본적으로 제한됩니다: 다른 객체 뒤에 부분적으로 가려진 객체는 하나의 시점만으로는 완전히 위치를 특정할 수 없고, 대칭 객체는 여러 개의 유효한 포즈를 허용합니다. 따라서 단일 뷰 방법들은 실용적으로 가장 중요한 시나리오 — 로봇 조작에서 흔히 발생하는, 객체들이 서로 접촉하고 가리는 복잡한 장면 — 에서 정확히 실패합니다. 다중 뷰 정보가 자연스러운 해결책이지만, 프레임별 포즈 제안을 단순히 누적하면 객체들이 서로를 관통하는 물리적으로 불가능한 상태가 생성됩니다. 물리 법칙을 고려한 공동 최적화가 필요합니다.
방법 및 아키텍처
시스템은 라이브 RGB-D 스트림에 대해 네 단계로 동작합니다(카메라 포즈는 로봇의 순방향 기구학으로부터, 또는 핸드헬드일 경우 ORB-SLAM2로부터 얻습니다):
- 객체 수준 체적 융합 — Mask R-CNN이 매 프레임 인스턴스 마스크를 생성합니다. 마스킹된 깊이는 검출된 각 객체 및 인식되지 않은 배경 구조마다 하나씩 존재하는 객체별 옥트리 점유 맵(OctoMap)에 융합됩니다. 인스턴스는 검출된 마스크와 렌더링된 마스크 간의 IoU로 프레임 간에 추적됩니다. 이를 통해 각 객체의 형상이 여러 뷰로부터 누적되며, 자유/미지 공간 정보도 함께 축적됩니다.
- 체적 포즈 예측 — 대상 객체마다 점유 그리드가 주어지며, 그 복셀은 자기 / 다른 객체 / 자유 / 미지()로 레이블링됩니다. 하나의 네트워크가 마스킹된 RGB의 ResNet-18 특징, 마스킹된 포인트 클라우드의 점별 인코딩, 이러한 특징들의 복셀화, 그리고 결합된 특징+점유 그리드에 대한 3D CNN을 결합한 뒤, 신뢰도와 함께 점별 포즈를 예측합니다. 학습은 모델 점 에 대한 DenseFusion 스타일의 포즈 손실을 사용합니다. 입니다. 대칭 객체의 경우 대응은 에 대한 최근접 이웃 최솟값이 되며, 비-대칭 손실로 워밍업하는 한 에폭을 거치면 비-볼록 형상에서 대칭 손실이 겪는 지역 최솟값 문제를 피할 수 있습니다.
- 충돌 기반 포즈 정제(ICC) — 모든 객체의 포즈는 미분 가능한 점유 복셀화를 통한 경사 하강법으로 함께 정제됩니다: 포즈 가설로 변환된 CAD 모델 점 는 복셀 좌표 로 매핑되고, 복셀 는 에 대해 점유값 를 갖습니다. 주변 객체 가설들은 원소별 최댓값으로 집계되어, 융합된 관통 불가능 공간 과 합집합을 이룹니다. 손실은 관통 불가능 공간과의 교차를 벌점화하는 동시에 객체 자신의 융합된 표면과의 중첩에 대해 보상합니다: 이는 GPU에서 배치 단위로 계산됩니다 — 접촉 중인 객체들이 서로를 제약합니다.
- CAD 정렬 — 최근 개 뷰별 가설들 사이의 쌍별 포즈 손실이 임계값 이내로 일치하면, CAD 모델이 그 합의된 포즈로 맵에 생성되어 중간 단계의 체적 표현을 대체합니다.
실험 결과
YCB-Video와 저자들이 만든 더 어려운 물리 시뮬레이션 기반 Cluttered YCB 데이터셋(1200개 장면 × 15프레임)에서 ADD(-S)/ADD-S AUC(최대 임계값 10,cm)로 평가했습니다. (웜업 손실 + 포인트 클라우드 중심화를 적용해) 재구현한 베이스라인 DenseFusion은 이미 공식 DenseFusion의 83.9/90.9를 YCB-Video에서 89.1/93.3으로 끌어올립니다. 결합된 데이터셋으로 학습한 MoreFusion은 YCB-Video에서 DenseFusion의 88.4/94.9 대비 91.0/95.7을 달성하고, Cluttered YCB에서는 81.7/91.7 대비 83.4/92.3을 달성하며, 심한 가림(가시성 < 30%) 상황에서는 그 차이가 63.5/85.1 대비 59.7/83.8로 더 벌어집니다. 테스트 시점에 더 풍부한 점유 컨텍스트(비-대상 및 배경의 완전한 재건)를 제공하면 85.5/93.8까지 더 개선됩니다 — 이는 정확히 점진적 매핑 시스템이 축적하는 정보입니다. 정제 단계에서는 Iterative Collision Check가 심한 가림 상황에서 ICP를 능가하며, ICC+ICP 조합이 항상 최고 성능을 보입니다(ICC가 이산화된 그리드에서 충돌을 해소한 뒤 ICP가 표면을 정밀하게 정렬). 핵심 시연은 실시간 로봇 팔이 온보드 RGB-D 비전만으로 복잡하게 쌓인 물체 더미를 분해하는 것입니다 — 목표 물체에 다가가기 위해 방해가 되는 물체들을 옆으로 치웁니다.
SLAM에서의 의미
MoreFusion은 의미론적 SLAM을 로봇 조작과 연결합니다: 서로 접촉하고 가리는 복잡한 탁상 장면은 단일 뷰 6D 포즈 추정기가 정확히 실패하는 지점이며, SLAM 방식의 다중 뷰, 맵 중심 접근법이 빛을 발하는 지점입니다. Fusion++의 객체별 볼륨 개념을 재건에서 정밀한 6D 포즈 추정으로 확장하며, 그 충돌 인식 공동 최적화는 상호 가림을 원리적으로 다루는 방법으로, 이후의 객체 수준 및 조작 지향 시스템들이 이를 기반으로 삼습니다.