VoT

Yugay 2025 · 논문

한 줄 요약 — Visual Odometry with Transformers(FVO로 재명명, “Fast Visual Odometry with Transformers”): 단안 VO를 고용량 시간-공간 Transformer와 신뢰도 가중 집계를 이용한 직접 상대 포즈 회귀로 공식화하여, 하이브리드 네트워크 + 번들 조정 파이프라인을 완전히 대체합니다.

문제

딥 네트워크와 고전적 최적화를 결합한 하이브리드 파이프라인이 visual odometry를 지배하고 있습니다: 신경망 예측과 번들 조정을 합치면 매우 정확한 궤적이 나옵니다. 하지만 이러한 하이브리드는 속도와 능력에서 순수 end-to-end 접근법에 못 미칩니다 — 이들은 스케일 모호성을 안고 학습된 거대하고 고정된(frozen) 사전 학습 3D 백본에 의존하므로, 파이프라인이 “본질적으로 이 한계를 물려받아, 설계상 절대 스케일을 추정하는 데 실패”합니다; 그리고 느린 최적화와 후처리 단계가 추론 속도의 병목이 됩니다. 번들 조정 기반 방법들은 또한 일반적으로 알려진 카메라 캘리브레이션을 가정합니다. FVO는 질문합니다: 후처리를 완전히 없애버리면 어떨까?

방법 및 아키텍처

파이프라인: 겹치는 프레임 윈도우 → 고정된 인코더 → 시간-공간 Transformer 디코더 → 쌍별 상대 포즈 + 신뢰도 → 신뢰도 가중 궤적 융합. 번들 조정도, 카메라 내부 파라미터도, 테스트 시점 최적화도 없습니다.

Procrustes(FR)=argminR^SO(3)R^FRF2\text{Procrustes}(\mathbf{F}_R) = \arg\min_{\hat{\mathbf{R}} \in \mathbb{SO}(3)} \|\hat{\mathbf{R}} - \mathbf{F}_R\|_F^2

L=Lrotexp(cR)+cR+Ltransexp(ct)+ct,\mathcal{L} = \mathcal{L}_{\text{rot}} \exp(-\mathbf{c}_R) + \mathbf{c}_R + \mathcal{L}_{\text{trans}} \exp(-\mathbf{c}_t) + \mathbf{c}_t,

따라서 신뢰도는 깊이나 대응점에 대한 감독 없이, 오직 포즈 레이블로부터 자기 감독적으로 학습됩니다. 이동은 학습 데이터셋 통계로 역정규화되어 미터 단위 궤적을 만듭니다.

실험 결과

정렬하지 않은(unaligned) ATE와 정렬한(aligned) ATE(RMSE, 미터 단위)로 평가됩니다 — 정렬하지 않은 지표가 중요한 이유는 실제 배포 환경에는 정렬할 정답 데이터가 없기 때문입니다:

SLAM에서의 의미

VoT/FVO는 기하학적 추정을 Transformer 아키텍처로 옮기는 더 넓은 흐름의 일부입니다 — 매칭에서 LoFTR을, 전체 다중 뷰 기하학에서 VGGT를 낳은 것과 같은 흐름입니다. SLAM 학습자에게 이 논문의 가치는 설계 공간의 end-to-end 극단을 보여주는 명확한 사례 연구라는 점입니다: 최적화기를 삭제함으로써 얻는 것(속도, 미터 단위 스케일, 캘리브레이션 불필요)과 잃는 것(해석 가능한 기하학적 백본, 동적 장면에서의 강건성)이 무엇인지 보여줍니다. 명명에 관한 참고: arXiv 논문은 처음 “VoT”로 등장했으며, 이후 FVO로 재명명되었습니다.

관련 문서