Align3R

Lu 2025 · 논문

한 줄 요약 — Align3R은 단안 깊이를 미세 조정된 DUSt3R에 주입하여, 프레임별로 깜빡이는 단안 깊이 예측을 시간적으로 일관된 비디오 깊이와 카메라 포즈로 동시에 변환합니다. DUSt3R이 예측하는 프레임 쌍별 3D pointmap이 이후 모든 프레임을 정렬합니다 (CVPR 2025 Highlight).

문제

최신 단안 깊이 추정 모델 (Depth Pro, Depth Anything V2)은 고품질의 단일 이미지 깊이를 생성하지만, 동적 비디오의 프레임 전반에 걸쳐 일관된 스케일 인자를 유지할 수 없어, 추정된 깊이 시퀀스가 깜빡입니다. 초기 해결책은 optical flow나 매칭 제약 조건을 사용한 추론 시점 최적화를 수행했지만, 이는 큰 움직임에서는 깨지고 수 시간이 걸립니다. 최근의 video-diffusion 접근법 (DepthCrafter, ChronoDepth)은 학습 비용이 높고, 고정 길이 클립으로 제한되며, 카메라 포즈 없이 스케일 불변 깊이만 출력합니다 — 4D 복원이나 추적에는 불충분합니다. Align3R은 diffusion의 비용을 지불하지 않고 동적 단안 비디오에 대해 일관된 비디오 깊이와 포즈를 얻는 방법을 묻습니다.

방법 및 아키텍처

NN개의 프레임 Ik\mathbf{I}_k가 주어지면, 단안 추정기가 먼저 프레임별 깊이 D^k\hat{\mathbf{D}}_k를 예측합니다. 그다음 수정된 DUSt3R이 이 깊이를 반영한 프레임 쌍별 pointmap을 예측하며, 마지막으로 전역 정렬이 깊이 Dk\mathbf{D}_k와 포즈 πkSE(3)\pi_k\in\mathbb{SE}(3)를 풉니다.

argminD,π,σeEveCveDvσePe(πv,Xve)22\arg\min_{\mathbf{D},\pi,\sigma}\sum_{e\in\mathcal{E}}\sum_{v\in e}\mathbf{C}^{e}_{v}\left\|\mathbf{D}_{v}-\sigma_{e}P_{e}(\pi_{v},\mathbf{X}^{e}_{v})\right\|_{2}^{2}

여기서 σe\sigma_e는 엣지별 스케일 인자이고 PeP_e는 pointmap을 뷰 vv로 투영하여 깊이 맵으로 만듭니다.

실험 결과

시퀀스당 하나의 scale/shift만 사용하여 (프레임당 정렬보다 더 엄격한 조건) 6개의 데이터셋에서 평가, Abs Rel \downarrow / δ<1.25\delta<1.25 \uparrow:

SLAM에서의 의미

프레임 간에 일관된 깊이는 dense visual odometry와 매핑이 정확히 필요로 하는 것입니다: 프레임마다 스스로 어긋나는 단안 깊이 네트워크는 포즈 추정과 맵 융합을 오염시킵니다. Align3R은 실용적인 레시피를 보여줍니다 — 세부 사항을 위한 foundation model 깊이, 기하학적 접착제로서의 DUSt3R 방식 프레임 쌍 pointmap, 그리고 백엔드로서의 DUSt3R 자체 전역 정렬 — 이를 통해 단일 이미지 깊이 모델을 비디오/SLAM 프론트엔드로 사용할 수 있게 되며, 동적 시퀀스에서의 포즈 정확도는 DROID-SLAM과 같은 전용 시스템에 필적합니다. 이는 순차적이고 동적인 데이터에 적응하고 있는 빠르게 발전 중인 DUSt3R 계열 (MonST3R, MASt3R-SLAM)에 속합니다.

관련 문서