핵심 개념
- 학습 기반 vs 수작업 설계 — 개별 고전 모듈(특징, 깊이, 매칭)을 신경망으로 대체하는 것 vs 종단간 학습
- 미분 가능성 — 고전적 최적화(RANSAC, BA)를 미분 가능하게 만들어 학습을 통과시킬 수 있도록 하는 것
- 파운데이션 모델 — 재사용 가능한 인식 백본으로서의 대규모 사전학습 모델(CLIP, SAM, DUSt3R 계열)
레벨 5는 다섯 개의 축으로 구성됩니다:
A. 프론트엔드 — 수작업 설계 모듈을 대체하는 학습된 인식 구성 요소
B. 백엔드 — 고전적 솔버를 대체하는 학습된/인증 가능한 최적화
C. 시스템 — 종단간 딥 VO/SLAM 파이프라인
D. 장면 이해 — SLAM 지도에 대한 시맨틱, 언어, 관계적 추론
E. 파운데이션 모델 및 신경망 SLAM — 포인트맵 Transformer, NeRF 및 3DGS 기반 밀도 SLAM 시스템
A. 딥러닝 프론트엔드 — 인식
특징 검출 및 매칭
| 시스템 |
저자/연도 |
핵심 개념 |
| NetVLAD |
Arandjelović 2016 |
VLAD, 장소 인식 |
| SuperPoint |
DeTone 2017 |
Homographic Adaptation, 자기지도 학습, VGG 인코더 + 검출기/디스크립터 헤드 |
| HardNet |
Mishchuk 2017 |
학습된 지역 디스크립터 |
| R2D2 |
Revaud 2019 |
반복 가능성 + 신뢰성을 갖춘 검출기/디스크립터, 명시적 반복성/신뢰도 맵 |
| KeyNet |
Barroso-Laguna 2019 |
학습된 키포인트 검출기 |
| HF-Net |
Sarlin 2019 |
전역 특징, 지역 특징, 시각적 위치 추정 |
| SuperGlue |
Sarlin 2020 |
Self/Cross-attention GNN, Sinkhorn 최적 할당, 이상치를 위한 dustbin |
| DISK |
Tyszkiewicz 2020 |
정책 그래디언트(RL) 학습, 매칭 성공/실패를 보상으로 사용 |
| Patch NetVLAD |
Hausler 2021 |
멀티스케일 패치 수준 VLAD |
| LoFTR |
Sun 2021 |
검출기 없는(detector-free) Transformer 기반 거친-세밀 밀도 매칭 |
| LightGlue |
Lindenberger 2023 |
적응형 깊이/너비, SuperGlue보다 5~10배 빠름 |
| XFeat |
Potje 2024 |
0.3M 파라미터, 1400 FPS(RTX 4090), 64차원 디스크립터, 임베디드 친화적 |
| RoMa |
Edstedt 2024 |
DINOv2 파운데이션 특징 + 거친-세밀 밀도 매칭 |
| DeDoDe |
Edstedt 2024 |
단일 단계에서의 검출-기술 공동 수행 |
| RoMa v2 |
Edstedt 2025 |
더 어렵고, 더 좋고, 더 빠르고, 더 밀도 있는 밀도 특징 매칭 |
깊이 추정
| 시스템 |
저자/연도 |
핵심 개념 |
| MonoDepth |
Godard 2016 |
좌우 광도 일관성, 자기지도 학습 |
| MiDaS |
Ranftl 2020 |
다중 데이터셋 혼합, 스케일-이동 불변 손실, 상대 깊이 |
| DPT |
Ranftl 2021 |
Dense Prediction Transformer(ViT 백본), 전역 컨텍스트 |
| ZoeDepth |
Bhat 2023 |
제로샷 미터 깊이, Metric Bins Module |
| Metric3D |
Yin 2023 |
카메라 내부 파라미터 조건화 미터 깊이, Canonical Camera Space |
| Depth Anything |
Yang 2024 |
6,200만 개 이미지, 단안 깊이를 위한 파운데이션 모델 |
| Depth Anything V2 |
Yang 2024 |
합성 데이터로 개선, 더 나은 에지 보존 |
| Depth Anything 3 |
Lin 2025 |
임의 입력으로부터의 any-view 기하, depth-ray 예측 타깃, 단일 plain transformer(DINOv2), teacher-student 학습 |
| Marigold |
Ke 2024 |
깊이 추정을 위한 Stable Diffusion, 미세한 디테일, 샘플링을 통한 불확실성 |
| Align3R |
Lu 2025 |
비디오 시간적 일관성, DUSt3R 기반, CVPR 2025 하이라이트 |
| Masked Depth Modeling (LingBot-Depth) |
Tan 2026 |
유리/거울/금속에서의 RGB-D 실패 해결 |
옵티컬 플로우 및 장면 플로우
카메라 포즈 회귀 및 재위치 추정
SLAM을 위한 객체 검출 및 분할
| 시스템 |
저자/연도 |
핵심 개념 |
| YOLO (v1→v11) |
Redmon 2016→2024 |
실시간 객체 검출, Ultralytics 생태계 |
| DETR |
Carion 2020 |
Transformer 검출, 앵커 없는(anchor-free) 방식, NMS 없음 |
| RT-DETR |
Zhao (Baidu) 2023 |
실시간 DETR, YOLO 수준의 속도 + Transformer 수준의 품질 |
| RF-DETR |
Robinson 2025 |
DETR에 대한 weight-sharing NAS, 정확도-지연시간 파레토 튜닝, COCO에서 60 AP를 넘은 최초의 실시간 검출기 |
| SAM |
Kirillov 2023 |
Segment Anything, 프롬프트 기반, 파운데이션 모델 |
| SAM 2 |
Meta 2024 |
비디오 분할, Memory Attention, 시간적 일관성 |
| SAM 3 |
Carion 2025 |
프롬프트 가능한 개념 세그먼테이션(명사구 / exemplar 프롬프트), presence 헤드, 검출기 + 메모리 기반 비디오 트래커 |
| Grounding DINO |
Liu 2023 |
텍스트 프롬프트 기반 검출 → SAM 파이프라인 (Grounded SAM) |
| Open-YOLO 3D |
Boudjoghra 2024 |
2D 오픈 어휘 검출 → 3D 인스턴스 분할, 16배 빠름 |
B. 딥러닝 백엔드 — 최적화
미분 가능 번들 조정
C. 종단간 딥 VO / SLAM 시스템
자기지도 학습 및 학습 기반 VO
| 시스템 |
저자/연도 |
핵심 개념 |
| DeepVO |
Wang 2017 |
지도 학습 |
| SfM-Learner |
Zhou 2017 |
비지도 학습, 딥 깊이 + 딥 포즈 |
| DeMoN |
Ummenhofer 2017 |
두 프레임으로부터의 깊이 + 모션, 인코더-디코더 |
| UndeepVO |
Li 2018 |
스테레오 자기지도 학습, 절대 스케일 복원 |
| DeepTAM |
Zhou 2018 |
딥러닝 기반 추적 및 매핑, 비용 볼륨 기반 |
| DeepV2D |
Teed 2018 |
비디오로부터의 반복적 깊이 추정, 미분 가능 기하 레이어 |
| Depth from Videos in the Wild |
Gordon 2019 |
제약 없는 비디오 깊이 추정, 학습된 카메라 내부 파라미터 |
| Neural Ray Surfaces |
Vasiljevic 2020 |
학습된 레이 표면 모델, 비핀홀 카메라 |
| GradSLAM |
Murthy 2020 |
미분 가능 SLAM 프레임워크 (PyTorch, 여러 SLAM 백엔드 지원) |
| DeepSLAM |
Li 2020 |
TrackingNet, MappingNet, LoopNet |
| MonoRec |
Wimbauer 2021 |
자기지도 학습 단안 3D 재구성, 움직이는 객체 |
| TANDEM |
Koestler 2021 |
MVS 깊이를 통한 실시간 추적 + 밀도 매핑, DSO 기반 |
학습 기반 SLAM 시스템
잠재 표현 SLAM
신경 렌더링 (참조)
NeRF/3DGS 기반 SLAM 시스템 → 아래 E축 참고
D. 장면 이해
벤치마크 및 기초
3D 장면 그래프
의미론적 / 언어 기반 SLAM
참고: LEGS, OpenGS-SLAM (위의 E축); Open-YOLO 3D (레벨 5 객체 검출)
E. 파운데이션 모델 및 신경망 표현 SLAM
파운데이션 모델 SLAM
NeRF 기반
| 시스템 |
저자/연도 |
핵심 개념 |
| iMAP |
Sucar 2021 |
최초의 NeRF-SLAM, 단일 MLP, 실시간 추적/매핑 |
| BARF |
Lin 2021 |
번들 조정 NeRF, 거친-세밀 위치 인코딩, 포즈+NeRF 공동 최적화 (완전한 SLAM은 아님 — 포즈+NeRF 공동 최적화) |
| NICE-SLAM |
Zhu & Peng 2022 |
계층적 특징 그리드(거침/중간/세밀), 확장 가능 |
| Co-SLAM |
Wang 2023 |
해시 그리드(Instant-NGP) + 좌표 인코딩, NICE-SLAM보다 5~10배 빠름 |
| ESLAM |
Johari 2023 |
트라이플레인 표현, O(N²) vs O(N³) 메모리 |
| Point-SLAM |
Sandström 2023 |
신경망 포인트 클라우드 기반 |
| NeRF-SLAM |
Rosinol 2023 |
NeRF + 고전적 SLAM 파이프라인 |
| NICER-SLAM |
Zhu 2024 |
RGB 전용 NeRF-SLAM(깊이 센서 없음), 단안 깊이 통합 |
| vMAP |
Kong 2023 |
객체 수준 NeRF-SLAM, 객체별 신경 필드 |
| GO-SLAM |
Zhang 2023 |
전역 최적화 + NeRF-SLAM, 루프 클로저 + 전역 BA |
3DGS 기반
| 시스템 |
저자/연도 |
핵심 개념 |
| SplaTAM |
Keetha 2024 |
최초의 3DGS SLAM 시스템 중 하나(GS-SLAM, MonoGS와 동시기), RGB-D, 실루엣 기반 밀집화 |
| MonoGS |
Matsuki 2024 |
최초의 단안 3DGS SLAM(CVPR 2024 하이라이트), 직접 래스터화 기반 추적, 해석적 카메라 야코비안 |
| GS-ICP SLAM |
Ha 2024 |
가우시안-대-가우시안 ICP(마할라노비스 거리), 기하학적 추적 |
| Photo-SLAM |
Huang 2024 |
명시적 기하 + 암시적 외관(MLP 색상), 안티앨리어싱 |
| RTG-SLAM |
Peng 2024 |
실시간에 초점, 적응형 가우시안 예산, Jetson Orin에서 25 FPS |
| EGG-Fusion |
Pan 2025 |
즉석 기하 인식 가우시안 서펠 융합, 정보 필터 기반, 실시간 |
| Online 3DGS Modeling |
Lee 2025 |
새로운 뷰 선택을 활용한 온라인 3D 가우시안 스플래팅 모델링 |
| ActiveSplat |
Li 2025 |
3DGS + Voronoi 기반 경로 계획을 활용한 능동 매핑 |
| OpenGS-SLAM |
Yang 2025 |
오픈셋 밀도 시맨틱 3DGS SLAM, 객체 수준 장면 이해 |
| LEGS |
Yu 2024 |
언어가 내재된 가우시안 스플랫, 실시간 언어 질의 가능 3D |