DSAC

Brachmann 2017 · 논문

한 줄 요약 — 결정론적 가설 선택을 확률적 선택으로 대체하여 RANSAC을 미분 가능하게 만들고, 강인한 포즈 추정기를 통해 scene coordinate 기반 카메라 위치 추정 파이프라인의 종단간 학습을 가능하게 합니다.

문제

RANSAC은 기하학적 비전 (multi-view geometry, 포즈 추정, SLAM)에서 “지역적으로 예측하고 전역적으로 피팅한다”는 방식을 따르는 강인한 추정의 핵심 도구입니다. 그러나 가장 높은 합의 점수를 가진 모델 가설을 취하는 가설 선택 방식, hAM=argmaxhJs(hJ,Y)\mathbf{h}_{\mathrm{AM}}=\arg\max_{\mathbf{h}_J} s(\mathbf{h}_J,Y)은 미분 불가능하여, RANSAC이 종단간으로 학습되는 딥러닝 파이프라인 내부에 위치할 수 없었습니다. 카메라 재위치추정 (relocalization)의 경우 특히, 딥러닝은 지금까지 전통적 접근법을 능가하지 못했습니다: 직접 포즈 회귀 (PoseNet)는 부정확하며 (장면당 중간값 이동 오차 약 40cm), scene coordinate regression은 기하학을 유지했지만 학습 가능한 구성 요소들이 실제로 중요한 포즈 손실이 아니라 대리 손실로만 학습될 수 있었습니다.

방법 및 아키텍처

이 파이프라인은 scene coordinate regression (SCoRF) 프레임워크를 따라 알려진 장면 내에서 RGB 이미지의 6-DoF 포즈 h~\tilde{\mathbf{h}}를 추정합니다:

선택 단계를 미분 가능하게 만드는 두 가지 경로가 비교됩니다:

w~,v~=argminw,vIIEJP(Jv,w)[(R(hJw,Yw))]\tilde{\mathbf{w}},\tilde{\mathbf{v}}=\arg\min_{\mathbf{w},\mathbf{v}}\sum_{I\in\mathcal{I}}\mathbb{E}_{J\sim P(J|\mathbf{v},\mathbf{w})}\left[\ell(\mathbf{R}(\mathbf{h}_J^{\mathbf{w}},Y^{\mathbf{w}}))\right]

이 그래디언트 자체가 기댓값입니다:

wEJ[()]=EJ[()wlogP(Jv,w)+w()]\frac{\partial}{\partial\mathbf{w}}\mathbb{E}_{J}\left[\ell(\cdot)\right]=\mathbb{E}_{J}\left[\ell(\cdot)\frac{\partial}{\partial\mathbf{w}}\log P(J|\mathbf{v},\mathbf{w})+\frac{\partial}{\partial\mathbf{w}}\ell(\cdot)\right]

학습 손실은 포즈 오차 pose(h,h)=max((θ,θ),tt)\ell_{\text{pose}}(\mathbf{h},\mathbf{h}^{*})=\max(\measuredangle(\boldsymbol{\theta},\boldsymbol{\theta}^{*}),\lVert\mathbf{t}-\mathbf{t}^{*}\rVert) 입니다 (회전은 도 단위, 이동은 cm 단위). 두 CNN은 먼저 구성 요소별로 학습됩니다 (L1L_1 coordinate 손실; 점수는 β=10\beta{=}10βpose-\beta\,\ell_{\text{pose}}에 대해 회귀), 그런 다음 종단간으로 학습됩니다. PnP와 정제의 도함수는 중심 차분 (central differences)을 통해 구합니다.

실험 결과

7-Scenes 데이터셋에서 (정확도 = 5cm / 5도 이내 테스트 프레임의 비율):

SLAM에서의 의미

DSAC은 scene coordinate regression을 실내 카메라 재위치추정의 지배적인 학습 기반 패러다임으로 확립했으며, 기하학적 solver를 루프 내에 유지하고 작업이 실제로 중요시하는 포즈 손실에 대해 학습하기 때문에 absolute pose regression을 크게 능가합니다. 미분 가능 RANSAC이라는 아이디어는 geometric deep learning 전반에 널리 확산되었습니다 — 논문은 이를 SfM 또는 SLAM을 종단간으로 학습하기 위한 강인한 최적화 구성 요소로 명시적으로 제안합니다 — 그리고 DSAC은 DSAC++, DSAC*, 그리고 오늘날 사용되는 빠른 학습 재위치추정기인 ACE 계열의 직접적인 선조입니다.

관련 문서