FlowNet3D

Liu 2019 · 논문

한 줄 요약 — 포인트 클라우드 상에서 3D scene flow를 추정하는 최초의 종단간(end-to-end) 딥 네트워크로, PointNet++ 백본에 새로운 flow embedding 레이어와 set upconv 레이어를 결합하여 모든 포인트에 대한 3D 모션 벡터를 예측한다.

문제

로보틱스와 인간-컴퓨터 상호작용은 동적 환경에서 포인트들의 3D 운동 — scene flow — 을 이해할 필요가 있지만, 기존 방법 대부분은 스테레오나 RGB-D 영상으로부터 이를 추정했고 포인트 클라우드에서 직접 다루려는 시도는 드물었다. LiDAR 포인트 클라우드는 희소하고 순서가 없으며 격자 구조가 없어 표준 CNN(및 이미지 공간 optical flow 아키텍처)을 적용할 수 없다. 기존 포인트 클라우드 파이프라인은 강체성이나 대응점 가정을 전제로 한 수작업 특징을 사용했다. FlowNet3D는 원시 포인트 클라우드 쌍으로부터 포인트별 3D 운동을 종단간으로 학습하는 방법을 묻는다.

방법 및 아키텍처

클라우드 P={xi}i=1n1\mathcal{P} = \{x_i\}_{i=1}^{n_1}Q={yj}j=1n2\mathcal{Q} = \{y_j\}_{j=1}^{n_2} (xi,yjR3x_i, y_j \in \mathbb{R}^3, 대응점 없음, 크기가 다를 수 있음)가 주어지면, 프레임 1의 모든 포인트에 대해 flow di=xixid_i = x_i' - x_i를 예측한다. 네트워크는 포인트 특징 학습, 포인트 혼합, flow 정제라는 세 모듈로 구성되며, 세 종류의 레이어로 만들어진다.

fj=MAX{i:xixjr}{h(fi, xixj)}f_j' = \underset{\{i \,:\, \lVert x_i - x_j' \rVert \le r\}}{\mathrm{MAX}} \big\{ h(f_i,\ x_i - x_j') \big\}

여기서 hh는 MLP이고 MAX는 원소별 최댓값 풀링이다 — 이는 비정형 데이터에 대해 계층적이고 평행이동에 불변인 기하 특징을 만들어낸다.

ei=MAX{j:yjxir}{h(fi, gj, yjxi)}e_i = \underset{\{j \,:\, \lVert y_j - x_i \rVert \le r\}}{\mathrm{MAX}} \big\{ h(f_i,\ g_j,\ y_j - x_i) \big\}

고정된 특징 거리 대신 두 포인트의 특징을 모두 hh에 입력함으로써, 네트워크는 후보 변위 yjxiy_j - x_i에 어떻게 가중치를 둘지 학습할 수 있다. 이렇게 얻은 임베딩은 이후 추가적인 set conv 레이어로 혼합되어 공간적 매끄러움을 얻는다 (넓은 수용 영역(receptive field)은 이동하는 테이블 위의 점들처럼 모호한 경우를 해소한다).

최종 아키텍처는 4개의 set conv 레이어, 1개의 flow embedding 레이어, (스킵 연결이 있는) 4개의 set upconv 레이어, 그리고 R3\mathbb{R}^3 flow를 회귀하는 선형 레이어로 구성된다. 학습에는 smooth-L1L_1 flow 감독과, 워프된 클라우드로부터 예측한 역방향 flow did_i'에 대한 사이클 일관성(cycle-consistency) 항이 함께 사용된다.

L=1n1i=1n1(didi+λdi+di)L = \frac{1}{n_1} \sum_{i=1}^{n_1} \Big( \lVert d_i - d_i^* \rVert + \lambda \lVert d_i' + d_i \rVert \Big)

λ=0.3\lambda = 0.3이다. 추론 시에는 샘플링 잡음을 줄이기 위해 클라우드를 무작위로 재샘플링하여 여러 번(10회) 실행하고 예측된 flow를 평균한다.

실험 결과

SLAM에서의 의미

FlowNet3D는 포인트 클라우드 상에서의 딥 scene flow 추정을 창시했으며, 이는 LiDAR SLAM 시스템이 동적 물체를 탐지하고 처리하는 방식의 기초가 된다 — 매핑이 의존해야 하는 정적 구조로부터 이동하는 차량과 보행자를 분리하는 것이다. 순서 없는 포인트 집합을 위한 이 소프트 대응점 레이어는 이후의 여러 후속 연구(PointPWC-Net, FLOT, FastFlow3D)에 영향을 주었고, RGB-D 측면의 이미지 기반 scene flow인 RAFT-3D를 보완한다. 그 정합 및 모션 세그멘테이션 시연은 SLAM 시스템이 scene flow를 정확히 어떻게 활용하는지를 미리 보여준다.

관련 문서