MASt3R
Leroy 2024 · 논문
한 줄 요약 — DUSt3R에 밀집 지역 특징 헤드를 추가하여 이미지 매칭을 3D에 접지시킴으로써, 극단적인 시점 변화에도 강건한 파운데이션 모델의 특성과 고전적 매처의 픽셀 정밀도 대응점을 결합한다.
문제
이미지 매칭은 최고 성능을 내는 모든 3D 비전 파이프라인의 핵심 구성 요소이지만, “매칭은 본질적으로 카메라 포즈 및 장면 기하와 근본적으로 연결된 3D 문제임에도, 일반적으로 2D 문제로 취급된다.” 고전적 및 학습 기반 2D 매처는 극단적인 시점 변화 아래에서 붕괴한다 — LoFTR는 Map-free에서 VCRE 정밀도가 34%에 불과하다; DUSt3R의 포인트맵 회귀는 바로 그런 조건에 대해 놀랍도록 강건하여 Map-free 리더보드 상위를 차지하지만, 회귀는 본질적으로 잡음이 있고 DUSt3R는 매칭을 위해 학습된 적이 없어 그 매치들은 정밀하지 않다. MASt3R(“Matching And Stereo 3D Reconstruction”)는 강건성을 유지하면서 정확도를 개선한다.
방법 및 아키텍처
기반 (DUSt3R 프레임워크): 샴 ViT 인코더 , , 교차 어텐션으로 정보를 교환하는 두 개의 상호 연결된 디코더 , 그리고 결합된 인코더/디코더 특징으로부터 포인트맵과 신뢰도를 회귀하는 3D 헤드: , 두 포인트맵 모두 카메라 1의 좌표계로 표현된다.
메트릭 예측: DUSt3R의 회귀 손실 은 예측과 정답을 모두 스케일 인자로 정규화한다; MASt3R는 정답이 메트릭 단위일 때마다 로 설정하여, 네트워크가 메트릭 스케일 기하를 학습하도록 한다 — 이는 맵 없는 위치추정의 전제조건이다. 신뢰도 가중 손실 는 그대로 유지된다.
매칭 헤드: 각 디코더에 부착된 새 헤드(GELU를 사용한 2계층 MLP, 출력은 단위 노름으로 정규화)가 밀집 차원 특징 맵 을 회귀한다. 정답 대응점 에 대한 InfoNCE 손실로 학습된다:
이는 본질적으로 교차 엔트로피 분류이다: 회귀와 달리, 네트워크는 오직 정확한 픽셀을 맞혔을 때만 보상을 받으므로 고정밀 디스크립터가 강제된다. 전체 목적함수: .
빠른 상호 매칭(FRM): 상호 최근접 이웃 을 그대로 추출하면 비용이 이 되어 — 네트워크 추론 자체보다도 느리다. FRM은 대신 정규 그리드 위의 개 픽셀에서 시작해 NN 왕복 을 반복하면서, 시작점으로 되돌아오는 픽셀(순환 = 상호 매치)을 모으고 수렴한 것들을 걸러낸다. 복잡도는 로 떨어져 거의 두 자릿수만큼 빨라지며 수렴 보장도 있다 — 그 암묵적인 이상값 필터링은 전수 매칭보다 오히려 포즈 정확도를 향상시킨다.
거친-세밀 매칭: 어텐션은 이미지 면적에 대해 이차적으로 증가하므로, MASt3R는 가장 긴 변이 최대 512px인 이미지만 다룬다. 고해상도 이미지는 먼저 거칠게 매칭되고, 이 거친 대응점이 열거된 지역 크롭의 매칭을 안내하며, 미세 매치는 다시 전체 해상도로 매핑된다.
실험 결과
- Map-free 재위치추정(테스트 세트): 자체 메트릭 깊이를 사용해 VCRE AUC 93.3% — 두 번째로 좋은 발표 방법인 LoFTR+KBR의 63.4%(DUSt3R: 69.7%)보다 절대 30포인트 개선 — 그리고 중간 이동 오차가 기존 최고 수준의 약 2m에서 0.36m로 줄어든다.
- 상대 포즈 (CO3Dv2 / RealEstate10K, 시퀀스당 10프레임, 정답 초점 거리 없음): CO3Dv2에서 RRA@15 94.6, RTA@15 91.9, mAA(30) 81.8, RealEstate10K에서 mAA(30) 76.4 — DUSt3R의 77.2, 61.2 대비 우수하며, RealEstate10K는 학습 시 전혀 보지 않은 데이터이다.
- DTU에서의 제로샷 MVS: 매치를 단순히 삼각측량하여 전체 Chamfer 0.374mm(정확도 0.403, 완전성 0.344) — DUSt3R의 1.741 대비 우수하며, DTU에서 학습하거나 매칭에 보정을 사용하지 않고도 GeoMVSNet(0.295) 같은 도메인 학습 방법에 근접한다.
- 시각적 위치추정: InLoc에서 최고 수준을 크게 능가하고 Aachen Day-Night에서 경쟁력이 있다; 검색된 단일 이미지(top1)만으로도 잘 위치추정되어, 3D에 접지된 매칭의 강건성을 보여준다.
- 에블레이션: 매칭 손실만으로 학습하면 포즈 정확도가 저하된다(두 손실을 함께 쓸 때 회전 중간 오차 3.0°인데 반해 10.8°) — 매칭을 3D 재구성에 접지시키는 것이 핵심이다.
SLAM에서의 의미
MASt3R는 DUSt3R 계열을 재구성 연구의 흥밋거리에서 실용적인 프론트엔드로 전환시켰다: 한 번의 순전파로 대응점과 메트릭 포인트맵을 얻어, 재위치추정, SfM, SLAM에 사용할 수 있다. SLAM 파이프라인 입장에서는 여러 고전적 단계 — 특징점 검출, 기술, 매칭, 2-뷰 기하 — 를 하나의 학습된 구성 요소로 압축하며, 그 실패 양상은 코너 부족이나 시점 변화가 아니라 파운데이션 모델 특유의 실패 양상이다. 이는 MASt3R-SLAM, MASt3R-SfM, MASt3R-Fusion의 직접적인 토대이다.