DeMoN

Ummenhofer 2017 · 논문

한 줄 요약 — DeMoN(CVPR 2017)은 2-뷰 구조-기반-모션(structure-from-motion)을 학습 문제로 공식화했다: 인코더-디코더를 여러 개 이어붙인 체인이 제약 없는 이미지 쌍으로부터 깊이와 카메라 모션을 함께 추정하며, 강제된 광류(optical flow) 예측을 통해 대응 관계를 학습한다.

문제

고전적인 2-뷰 SfM은 keypoint 검출, 디스크립터 매칭, essential 행렬 추정, 밀집 스테레오를 연쇄적으로 수행한다 — 모션이 희소하고 outlier가 많은 대응 관계로부터 먼저 추정되기 때문에, 잘못된 모션 추정이 깊이를 오염시키고, 텍스처가 부족한 영역에서는 실패하며, 카메라 이동이 작을 때 기존 파이프라인 전체가 무너진다. 단일 이미지 깊이 네트워크는 매칭을 피하지만 순전히 외관(appearance) 사전 정보에 의존하기 때문에 학습 분포 밖에서는 일반화 성능이 떨어진다. DeMoN은 연속된 제약 없는 이미지 쌍으로부터 깊이와 모션을 계산하도록 네트워크를 종단간(end-to-end)으로 학습시키며 — 단순한 접근이 실패한다는 것을 보여준다: 두 프레임을 입력받는 평범한 인코더-디코더는 단일 이미지의 손쉬운 경로(shortcut)를 택해 두 번째 이미지를 그냥 무시해버린다.

방법 및 아키텍처

gh[f]=(f(i+h,j)f(i,j)f(i+h,j)+f(i,j), f(i,j+h)f(i,j)f(i,j+h)+f(i,j)),\mathbf{g}_{h}[f]=\left(\tfrac{f(i+h,j)-f(i,j)}{|f(i+h,j)|+|f(i,j)|},\ \tfrac{f(i,j+h)-f(i,j)}{|f(i,j+h)|+|f(i,j)|}\right)^{\top},

Lgradξ=h{1,2,4,8,16}i,j gh[ξ]gh[ξ^] 2,\mathcal{L}_{\text{grad}\,\xi}=\sum_{h\in\{1,2,4,8,16\}}\sum_{i,j}\left\|\ \mathbf{g}_{h}[\xi]-\mathbf{g}_{h}[\hat{\xi}]\ \right\|_{2},

5개의 간격(spacing)에 걸쳐 인접 픽셀 간의 상대적 깊이 오차에 페널티를 주어 — 깊이 불연속 지점을 더 뚜렷하게 만들고 균일한 영역을 매끄럽게 한다.

실험 결과

SLAM에서의 의미

DeMoN은 “네트워크에 두 이미지를 입력하면 기하학적 정보가 나온다”는 계열의 원조다. 학습된 2-뷰 기하학에는 인식(recognition)만이 아니라 매칭이 필요하다는 것을 보여주었으며 — 이 교훈은 지금도 프론트엔드 설계에 영향을 미친다 — 그 학습된 iterative refinement는 BA-Net, DeepV2D, RAFT 계열 시스템을 예고했고, 제약 없는 2-뷰 설정은 DUSt3R이 파운데이션 모델 규모에서 다시 다루는 바로 그 문제다.

관련 문서