TartanVO

Wang 2021 · 논문

한 줄 요약 — TartanAir의 다양한 합성 데이터만으로 학습되어, 파인튜닝 없이 여러 실세계 데이터셋에 걸쳐 일반화하는 최초의 학습 기반 시각 오도메트리 모델입니다.

문제

이전의 학습 기반 VO 방법들은 동일한 데이터셋(대개 KITTI)에서 학습 및 테스트되어 도메인 간 일반화에 실패했으며, 고전적인 기하학 기반 VO는 일반화되지만 모션 블러, 급격한 회전, 조명 변화에 어려움을 겪습니다. 이 논문은 두 가지 원인을 지목합니다: (1) 장면 및 운동 패턴의 다양성이 부족한 학습 데이터, (2) 다중 뷰 기하학의 두 가지 근본적인 모호성 — 단안 스케일 모호성과 카메라 내부 파라미터에 대한 의존성 — 을 무시한 것이며, 그 결과 “특징 추출기가 얼마나 우수하든, 한 데이터셋에서 학습된 모델은 다른 데이터셋에서 실패하기 쉽습니다.”

방법 및 아키텍처

2단계 네트워크. 연속된 왜곡 보정 이미지 {It,It+1}\{I_t, I_{t+1}\}가 주어지면, 매칭 모듈 Mθ(It,It+1)M_\theta(I_t, I_{t+1})(사전 학습된 PWC-Net)이 밀집 광학 흐름 Ftt+1F_t^{t+1}을 추정하고, 포즈 모듈 Pϕ(Ftt+1,K)P_\phi(F_t^{t+1}, K)(병진과 회전을 위한 별도 헤드를 가지며 배치 정규화가 없는 수정된 ResNet50)이 상대 운동 δtt+1=(T,R)\delta_t^{t+1} = (T, R), TR3T \in \mathbb{R}^3, Rso(3)R \in so(3)을 회귀합니다. 종단간 목적 함수는 두 가지를 함께 감독합니다:

L=λLf+Lp=λMθ(It,It+1)Ftt+1+Pϕ(F^tt+1)δtt+1L = \lambda L_f + L_p = \lambda \lVert M_\theta(I_t, I_{t+1}) - F_t^{t+1} \rVert + \lVert P_\phi(\hat{F}_t^{t+1}) - \delta_t^{t+1} \rVert

스케일-상대적 손실. 운동 스케일은 단안 이미지에서 관측 불가능하므로, 병진 방향만 감독됩니다(회전 손실은 변경 없음). 논문에서 사용된 정규화된 거리 형태는 다음과 같습니다:

Lpnorm=T^max(T^,ϵ)Tmax(T,ϵ)+R^R,ϵ=106L_p^{norm} = \left\lVert \frac{\hat{T}}{\max(\lVert\hat{T}\rVert, \epsilon)} - \frac{T}{\max(\lVert T \rVert, \epsilon)} \right\rVert + \lVert \hat{R} - R \rVert, \qquad \epsilon = 10^{-6}

(코사인 유사도 변형도 비슷한 성능을 보입니다.) 이는 스케일을 인지하는 손실이 남겨두는 학습/테스트 병진 손실 간극을 닫습니다.

내부 파라미터 레이어(IL). 내부 파라미터 모호성을 해결하기 위해, 내부 파라미터 K={fx,fy,ox,oy}K = \{f_x, f_y, o_x, o_y\}로부터 만든 2채널 맵 KcR2×H×WK^c \in \mathbb{R}^{2\times H\times W}가 포즈 네트워크 앞에서 흐름에 연결됩니다:

Kxc=(Xindox)/fx,Kyc=(Yindoy)/fyK_x^c = (X_{ind} - o_x)/f_x, \qquad K_y^c = (Y_{ind} - o_y)/f_y

이는 각 흐름 벡터에 정규화된 2D 위치를 부여하는데, 이는 기하학적 방법이 매칭으로부터 포즈를 복원할 때 필요로 하는 것과 동일한 정보입니다. TartanAir가 고정된 카메라 하나(fx=fy=320f_x = f_y = 320, ox=320o_x = 320, oy=240o_y = 240)만 가지므로, 무작위 크롭 및 리사이즈(RCR, 리사이즈 배율 최대 2.5)를 통해 4040^{\circ}에서 9090^{\circ}까지의 시야각을 갖는 가상 카메라를 합성합니다.

학습. TartanAir(40만 프레임 이상, 20개 환경, 3개는 검증용으로 보류)만으로 학습됩니다: 먼저 PϕP_\phi만을 실측 흐름으로(10만 반복, 배치 100) 학습한 뒤, MθM_\theta와 함께 결합 학습합니다(5만 반복, 배치 64). 추론은 GTX 1080에서 이미지 쌍당 40 ms가 걸립니다. 모든 테스트 데이터셋에 동일한 가중치가 사용됩니다 — 어디에도 파인튜닝은 없습니다.

실험 결과

SLAM에서의 의미

TartanVO는 시각 오도메트리에서 sim-to-real 전이가 가능함을 입증했습니다: 순수하게 시뮬레이션에서 학습된 단일 모델이 KITTI, EuRoC, 실제 IR 영상으로 일반화되었고, 고전적인 기하학 기반 파이프라인이 실패하는 조건(모션 블러, 급격한 MAV 운동, 저조도)에서도 견뎌냈습니다. 두 가지 지속적인 교훈 — 대규모의 다양한 합성 데이터로 학습하고, 기하학적 불변성(스케일, 내부 파라미터)을 모델에 내재시키는 것 — 은 모두 TartanAir로 학습된 DROID-SLAM, DPVO, MAC-VO로 직접 이어지며, MAC-VO는 TartanVO를 자신의 운동 모델 초기화 도구로까지 사용합니다.

관련 문서