MASt3R

Leroy 2024 · 논문

한 줄 요약 — DUSt3R에 밀집 지역 특징 헤드를 추가하여 이미지 매칭을 3D에 접지시킴으로써, 극단적인 시점 변화에도 강건한 파운데이션 모델의 특성과 고전적 매처의 픽셀 정밀도 대응점을 결합한다.

문제

이미지 매칭은 최고 성능을 내는 모든 3D 비전 파이프라인의 핵심 구성 요소이지만, “매칭은 본질적으로 카메라 포즈 및 장면 기하와 근본적으로 연결된 3D 문제임에도, 일반적으로 2D 문제로 취급된다.” 고전적 및 학습 기반 2D 매처는 극단적인 시점 변화 아래에서 붕괴한다 — LoFTR는 Map-free에서 VCRE 정밀도가 34%에 불과하다; DUSt3R의 포인트맵 회귀는 바로 그런 조건에 대해 놀랍도록 강건하여 Map-free 리더보드 상위를 차지하지만, 회귀는 본질적으로 잡음이 있고 DUSt3R는 매칭을 위해 학습된 적이 없어 그 매치들은 정밀하지 않다. MASt3R(“Matching And Stereo 3D Reconstruction”)는 강건성을 유지하면서 정확도를 개선한다.

방법 및 아키텍처

기반 (DUSt3R 프레임워크): 샴 ViT 인코더 H1=Encoder(I1)H^1 = \text{Encoder}(I^1), H2=Encoder(I2)H^2 = \text{Encoder}(I^2), 교차 어텐션으로 정보를 교환하는 두 개의 상호 연결된 디코더 H1,H2=Decoder(H1,H2)H'^1, H'^2 = \text{Decoder}(H^1, H^2), 그리고 결합된 인코더/디코더 특징으로부터 포인트맵과 신뢰도를 회귀하는 3D 헤드: X1,1,C1=Head3D1([H1,H1])X^{1,1}, C^1 = \text{Head}^1_{3D}([H^1, H'^1]), 두 포인트맵 모두 카메라 1의 좌표계로 표현된다.

메트릭 예측: DUSt3R의 회귀 손실 regr(v,i)=Xiv,1/zX^iv,1/z^\ell_{\text{regr}}(v,i) = \| X_i^{v,1}/z - \hat{X}_i^{v,1}/\hat{z} \|은 예측과 정답을 모두 스케일 인자로 정규화한다; MASt3R는 정답이 메트릭 단위일 때마다 z:=z^z := \hat{z}로 설정하여, 네트워크가 메트릭 스케일 기하를 학습하도록 한다 — 이는 맵 없는 위치추정의 전제조건이다. 신뢰도 가중 손실 Lconf=viCivregr(v,i)αlogCiv\mathcal{L}_{\text{conf}} = \sum_{v} \sum_{i} C_i^v \ell_{\text{regr}}(v,i) - \alpha \log C_i^v는 그대로 유지된다.

매칭 헤드: 각 디코더에 부착된 새 헤드(GELU를 사용한 2계층 MLP, 출력은 단위 노름으로 정규화)가 밀집 dd차원 특징 맵 D1,D2RH×W×dD^1, D^2 \in \mathbb{R}^{H \times W \times d}을 회귀한다. 정답 대응점 M^={(i,j)X^i1,1=X^j2,1}\hat{\mathcal{M}} = \{(i,j) \mid \hat{X}_i^{1,1} = \hat{X}_j^{2,1}\}에 대한 InfoNCE 손실로 학습된다:

Lmatch=(i,j)M^logsτ(i,j)kP1sτ(k,j)+logsτ(i,j)kP2sτ(i,k),sτ(i,j)=exp[τDi1Dj2].\mathcal{L}_{\text{match}} = -\sum_{(i,j) \in \hat{\mathcal{M}}} \log \frac{s_\tau(i,j)}{\sum_{k \in \mathcal{P}^1} s_\tau(k,j)} + \log \frac{s_\tau(i,j)}{\sum_{k \in \mathcal{P}^2} s_\tau(i,k)}, \qquad s_\tau(i,j) = \exp\left[-\tau D_i^{1\top} D_j^2\right].

이는 본질적으로 교차 엔트로피 분류이다: 회귀와 달리, 네트워크는 오직 정확한 픽셀을 맞혔을 때만 보상을 받으므로 고정밀 디스크립터가 강제된다. 전체 목적함수: Ltotal=Lconf+βLmatch\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{conf}} + \beta \mathcal{L}_{\text{match}}.

빠른 상호 매칭(FRM): 상호 최근접 이웃 M={(i,j)j=NN2(Di1) and i=NN1(Dj2)}\mathcal{M} = \{(i,j) \mid j = \text{NN}_2(D_i^1) \text{ and } i = \text{NN}_1(D_j^2)\}을 그대로 추출하면 비용이 O(W2H2)O(W^2H^2)이 되어 — 네트워크 추론 자체보다도 느리다. FRM은 대신 정규 그리드 위의 kk개 픽셀에서 시작해 NN 왕복 UtVtUt+1U^t \to V^t \to U^{t+1}을 반복하면서, 시작점으로 되돌아오는 픽셀(순환 = 상호 매치)을 모으고 수렴한 것들을 걸러낸다. 복잡도는 O(kWH)O(kWH)로 떨어져 거의 두 자릿수만큼 빨라지며 수렴 보장도 있다 — 그 암묵적인 이상값 필터링은 전수 매칭보다 오히려 포즈 정확도를 향상시킨다.

거친-세밀 매칭: 어텐션은 이미지 면적에 대해 이차적으로 증가하므로, MASt3R는 가장 긴 변이 최대 512px인 이미지만 다룬다. 고해상도 이미지는 먼저 거칠게 매칭되고, 이 거친 대응점이 열거된 지역 크롭의 매칭을 안내하며, 미세 매치는 다시 전체 해상도로 매핑된다.

실험 결과

SLAM에서의 의미

MASt3R는 DUSt3R 계열을 재구성 연구의 흥밋거리에서 실용적인 프론트엔드로 전환시켰다: 한 번의 순전파로 대응점과 메트릭 포인트맵을 얻어, 재위치추정, SfM, SLAM에 사용할 수 있다. SLAM 파이프라인 입장에서는 여러 고전적 단계 — 특징점 검출, 기술, 매칭, 2-뷰 기하 — 를 하나의 학습된 구성 요소로 압축하며, 그 실패 양상은 코너 부족이나 시점 변화가 아니라 파운데이션 모델 특유의 실패 양상이다. 이는 MASt3R-SLAM, MASt3R-SfM, MASt3R-Fusion의 직접적인 토대이다.

관련 문서