TartanVO
Wang 2021 · 논문
한 줄 요약 — TartanAir의 다양한 합성 데이터만으로 학습되어, 파인튜닝 없이 여러 실세계 데이터셋에 걸쳐 일반화하는 최초의 학습 기반 시각 오도메트리 모델입니다.
문제
이전의 학습 기반 VO 방법들은 동일한 데이터셋(대개 KITTI)에서 학습 및 테스트되어 도메인 간 일반화에 실패했으며, 고전적인 기하학 기반 VO는 일반화되지만 모션 블러, 급격한 회전, 조명 변화에 어려움을 겪습니다. 이 논문은 두 가지 원인을 지목합니다: (1) 장면 및 운동 패턴의 다양성이 부족한 학습 데이터, (2) 다중 뷰 기하학의 두 가지 근본적인 모호성 — 단안 스케일 모호성과 카메라 내부 파라미터에 대한 의존성 — 을 무시한 것이며, 그 결과 “특징 추출기가 얼마나 우수하든, 한 데이터셋에서 학습된 모델은 다른 데이터셋에서 실패하기 쉽습니다.”
방법 및 아키텍처
2단계 네트워크. 연속된 왜곡 보정 이미지 가 주어지면, 매칭 모듈 (사전 학습된 PWC-Net)이 밀집 광학 흐름 을 추정하고, 포즈 모듈 (병진과 회전을 위한 별도 헤드를 가지며 배치 정규화가 없는 수정된 ResNet50)이 상대 운동 , , 을 회귀합니다. 종단간 목적 함수는 두 가지를 함께 감독합니다:
스케일-상대적 손실. 운동 스케일은 단안 이미지에서 관측 불가능하므로, 병진 방향만 감독됩니다(회전 손실은 변경 없음). 논문에서 사용된 정규화된 거리 형태는 다음과 같습니다:
(코사인 유사도 변형도 비슷한 성능을 보입니다.) 이는 스케일을 인지하는 손실이 남겨두는 학습/테스트 병진 손실 간극을 닫습니다.
내부 파라미터 레이어(IL). 내부 파라미터 모호성을 해결하기 위해, 내부 파라미터 로부터 만든 2채널 맵 가 포즈 네트워크 앞에서 흐름에 연결됩니다:
이는 각 흐름 벡터에 정규화된 2D 위치를 부여하는데, 이는 기하학적 방법이 매칭으로부터 포즈를 복원할 때 필요로 하는 것과 동일한 정보입니다. TartanAir가 고정된 카메라 하나(, , )만 가지므로, 무작위 크롭 및 리사이즈(RCR, 리사이즈 배율 최대 2.5)를 통해 에서 까지의 시야각을 갖는 가상 카메라를 합성합니다.
학습. TartanAir(40만 프레임 이상, 20개 환경, 3개는 검증용으로 보류)만으로 학습됩니다: 먼저 만을 실측 흐름으로(10만 반복, 배치 100) 학습한 뒤, 와 함께 결합 학습합니다(5만 반복, 배치 64). 추론은 GTX 1080에서 이미지 쌍당 40 ms가 걸립니다. 모든 테스트 데이터셋에 동일한 가중치가 사용됩니다 — 어디에도 파인튜닝은 없습니다.
실험 결과
- 에이블레이션: 학습 데이터가 2만에서 10만, 40만 프레임으로 증가할수록 학습/테스트 일반화 간극이 단조적으로 줄어듭니다. 내부 파라미터가 달라지면 IL이 결정적이며(RCR 조건에서 IL 사용 시 테스트 손실 0.0723 대비 미사용 시 0.1999), RCR + IL로 학습하면 단일 내부 파라미터로 학습한 경우보다 더 잘 일반화됩니다.
- KITTI(제로샷, 2프레임 VO만): 시퀀스 06/07/09/10 평균 5.48% / 3.05°/100m — KITTI로 학습한 DeepVO(5.81/6.41)보다 우수하고, 기하학 기반 VISO2-M(15.04/7.62)과 단안 ORB-SLAM의 (12.16)보다 훨씬 우수합니다. KITTI를 전혀 본 적이 없음에도 그렇습니다.
- EuRoC(제로샷): 어떤 백엔드 최적화 없이도 기하학 기반 방법과 경쟁할 만한 ATE를 보이며, 가장 어려운 두 시퀀스에서 비교된 모든 방법 중 최고입니다 — VR1-03(0.64, DSO 0.93; SVO/ORB-SLAM/LSD-SLAM은 실패)과 VR2-03(1.04, DSO 1.16).
- TartanAir 챌린지 시퀀스: 16개의 어려운 테스트 궤적 전부를 추적합니다(MH000-007 평균 ATE 1.92). ORB-SLAM은 8개 중 2개에서 실패하고 MH006에서 21.47을 기록합니다.
- 실제 IR 카메라: RealSense D435i 적외선 입력에서, 실제 이미지나 IR 이미지를 학습 시 전혀 본 적이 없음에도, 전용 T265 추적 카메라(어안 스테레오 + IMU)의 궤적과 거의 일치합니다.
SLAM에서의 의미
TartanVO는 시각 오도메트리에서 sim-to-real 전이가 가능함을 입증했습니다: 순수하게 시뮬레이션에서 학습된 단일 모델이 KITTI, EuRoC, 실제 IR 영상으로 일반화되었고, 고전적인 기하학 기반 파이프라인이 실패하는 조건(모션 블러, 급격한 MAV 운동, 저조도)에서도 견뎌냈습니다. 두 가지 지속적인 교훈 — 대규모의 다양한 합성 데이터로 학습하고, 기하학적 불변성(스케일, 내부 파라미터)을 모델에 내재시키는 것 — 은 모두 TartanAir로 학습된 DROID-SLAM, DPVO, MAC-VO로 직접 이어지며, MAC-VO는 TartanVO를 자신의 운동 모델 초기화 도구로까지 사용합니다.