레벨 05 / 11

딥러닝 + SLAM

학습된 프론트엔드, 미분 가능 백엔드, 종단간 시스템, 파운데이션 모델 및 신경망 SLAM, 장면 이해

핵심 개념

레벨 5는 다섯 개의 축으로 구성됩니다: A. 프론트엔드 — 수작업 설계 모듈을 대체하는 학습된 인식 구성 요소 B. 백엔드 — 고전적 솔버를 대체하는 학습된/인증 가능한 최적화 C. 시스템 — 종단간 딥 VO/SLAM 파이프라인 D. 장면 이해 — SLAM 지도에 대한 시맨틱, 언어, 관계적 추론 E. 파운데이션 모델 및 신경망 SLAM — 포인트맵 Transformer, NeRF 및 3DGS 기반 밀도 SLAM 시스템

A. 딥러닝 프론트엔드 — 인식

특징 검출 및 매칭

시스템 저자/연도 핵심 개념
NetVLAD Arandjelović 2016 VLAD, 장소 인식
SuperPoint DeTone 2017 Homographic Adaptation, 자기지도 학습, VGG 인코더 + 검출기/디스크립터 헤드
HardNet Mishchuk 2017 학습된 지역 디스크립터
R2D2 Revaud 2019 반복 가능성 + 신뢰성을 갖춘 검출기/디스크립터, 명시적 반복성/신뢰도 맵
KeyNet Barroso-Laguna 2019 학습된 키포인트 검출기
HF-Net Sarlin 2019 전역 특징, 지역 특징, 시각적 위치 추정
SuperGlue Sarlin 2020 Self/Cross-attention GNN, Sinkhorn 최적 할당, 이상치를 위한 dustbin
DISK Tyszkiewicz 2020 정책 그래디언트(RL) 학습, 매칭 성공/실패를 보상으로 사용
Patch NetVLAD Hausler 2021 멀티스케일 패치 수준 VLAD
LoFTR Sun 2021 검출기 없는(detector-free) Transformer 기반 거친-세밀 밀도 매칭
LightGlue Lindenberger 2023 적응형 깊이/너비, SuperGlue보다 5~10배 빠름
XFeat Potje 2024 0.3M 파라미터, 1400 FPS(RTX 4090), 64차원 디스크립터, 임베디드 친화적
RoMa Edstedt 2024 DINOv2 파운데이션 특징 + 거친-세밀 밀도 매칭
DeDoDe Edstedt 2024 단일 단계에서의 검출-기술 공동 수행
RoMa v2 Edstedt 2025 더 어렵고, 더 좋고, 더 빠르고, 더 밀도 있는 밀도 특징 매칭

깊이 추정

시스템 저자/연도 핵심 개념
MonoDepth Godard 2016 좌우 광도 일관성, 자기지도 학습
MiDaS Ranftl 2020 다중 데이터셋 혼합, 스케일-이동 불변 손실, 상대 깊이
DPT Ranftl 2021 Dense Prediction Transformer(ViT 백본), 전역 컨텍스트
ZoeDepth Bhat 2023 제로샷 미터 깊이, Metric Bins Module
Metric3D Yin 2023 카메라 내부 파라미터 조건화 미터 깊이, Canonical Camera Space
Depth Anything Yang 2024 6,200만 개 이미지, 단안 깊이를 위한 파운데이션 모델
Depth Anything V2 Yang 2024 합성 데이터로 개선, 더 나은 에지 보존
Depth Anything 3 Lin 2025 임의 입력으로부터의 any-view 기하, depth-ray 예측 타깃, 단일 plain transformer(DINOv2), teacher-student 학습
Marigold Ke 2024 깊이 추정을 위한 Stable Diffusion, 미세한 디테일, 샘플링을 통한 불확실성
Align3R Lu 2025 비디오 시간적 일관성, DUSt3R 기반, CVPR 2025 하이라이트
Masked Depth Modeling (LingBot-Depth) Tan 2026 유리/거울/금속에서의 RGB-D 실패 해결

옵티컬 플로우 및 장면 플로우

시스템 저자/연도 핵심 개념
FlowNet Dosovitskiy 2015 최초의 종단간 딥러닝 옵티컬 플로우 (SimpleNet / CorrNet)
FlowNet 2.0 Ilg 2017 스택형 네트워크, 고전적 방법 수준의 정확도
PWC-Net Sun 2018 피라미드-워핑-비용 볼륨, 거친-세밀, 840만 파라미터
FlowNet3D Liu 2019 포인트 클라우드 장면 플로우, PointNet++ 기반
RAFT Teed 2020 All-Pairs 상관 + 반복적 ConvGRU 업데이트, ECCV 최우수 논문상
RAFT-3D Teed 2021 RAFT로부터 얻는 장면 플로우(3D 모션)
FlowFormer Huang 2022 비용 볼륨 토큰에 대한 Transformer, 전역 컨텍스트
SEA-RAFT Wang 2024 실시간을 위한 효율적인 RAFT 변형

카메라 포즈 회귀 및 재위치 추정

시스템 저자/연도 핵심 개념
PoseNet Kendall 2015 CNN 기반 6자유도 포즈 회귀(APR), GoogLeNet 백본
DSAC Brachmann 2017 미분 가능 RANSAC, Scene Coordinate Regression(SCR)
DSAC++ Brachmann 2018 자기지도 학습, RGB-D 지원
CNN Pose Regression Limitations Sattler 2019 포즈 회귀 ≈ 이미지 검색 성능
LM-Reloc von Stumberg 2020 딥러닝 기반 직접 재지역화
DSAC* Brachmann 2021 RGB/RGB-D로부터의 시각적 재지역화, 향상된 학습 안정성(TPAMI)
ACE Brachmann 2023 Accelerated Coordinate Encoding, 장면당 5분 학습
ACE Zero Brachmann 2024 제로샷 SCR, 사전 구축된 3D 지도 불필요
ACE-G Bruns 2025 쿼리 사전학습을 통한 일반화 가능 SCR, 미세조정 없이 새로운 장면에 적용
ACE-SLAM Alzugaray 2025 신경망 암시적 실시간 SLAM, 네트워크 가중치 = 지도
hloc Sarlin 2019 HF-Net의 계층적 위치 추정을 구현한 툴박스: 거침(NetVLAD) → 세밀(SuperGlue)

SLAM을 위한 객체 검출 및 분할

시스템 저자/연도 핵심 개념
YOLO (v1→v11) Redmon 2016→2024 실시간 객체 검출, Ultralytics 생태계
DETR Carion 2020 Transformer 검출, 앵커 없는(anchor-free) 방식, NMS 없음
RT-DETR Zhao (Baidu) 2023 실시간 DETR, YOLO 수준의 속도 + Transformer 수준의 품질
RF-DETR Robinson 2025 DETR에 대한 weight-sharing NAS, 정확도-지연시간 파레토 튜닝, COCO에서 60 AP를 넘은 최초의 실시간 검출기
SAM Kirillov 2023 Segment Anything, 프롬프트 기반, 파운데이션 모델
SAM 2 Meta 2024 비디오 분할, Memory Attention, 시간적 일관성
SAM 3 Carion 2025 프롬프트 가능한 개념 세그먼테이션(명사구 / exemplar 프롬프트), presence 헤드, 검출기 + 메모리 기반 비디오 트래커
Grounding DINO Liu 2023 텍스트 프롬프트 기반 검출 → SAM 파이프라인 (Grounded SAM)
Open-YOLO 3D Boudjoghra 2024 2D 오픈 어휘 검출 → 3D 인스턴스 분할, 16배 빠름

B. 딥러닝 백엔드 — 최적화

미분 가능 번들 조정

시스템 저자/연도 핵심 개념
BA-Net Tang 2019 FPN + 미분 가능 LM 레이어, 종단간 SfM (ICLR)
DROID-SLAM Teed 2021 밀도 옵티컬 플로우 + 미분 가능 밀도 BA, 모든 픽셀 재투영
DPVO Teed 2023 패치 기반 DROID-SLAM, 30+ FPS 실시간
Theseus Pineda (Meta) 2022 미분 가능 비선형 최적화 라이브러리(PyTorch)
Lietorch Teed 2021 PyTorch를 위한 리 군 연산(SE(3)/SO(3))

C. 종단간 딥 VO / SLAM 시스템

자기지도 학습 및 학습 기반 VO

시스템 저자/연도 핵심 개념
DeepVO Wang 2017 지도 학습
SfM-Learner Zhou 2017 비지도 학습, 딥 깊이 + 딥 포즈
DeMoN Ummenhofer 2017 두 프레임으로부터의 깊이 + 모션, 인코더-디코더
UndeepVO Li 2018 스테레오 자기지도 학습, 절대 스케일 복원
DeepTAM Zhou 2018 딥러닝 기반 추적 및 매핑, 비용 볼륨 기반
DeepV2D Teed 2018 비디오로부터의 반복적 깊이 추정, 미분 가능 기하 레이어
Depth from Videos in the Wild Gordon 2019 제약 없는 비디오 깊이 추정, 학습된 카메라 내부 파라미터
Neural Ray Surfaces Vasiljevic 2020 학습된 레이 표면 모델, 비핀홀 카메라
GradSLAM Murthy 2020 미분 가능 SLAM 프레임워크 (PyTorch, 여러 SLAM 백엔드 지원)
DeepSLAM Li 2020 TrackingNet, MappingNet, LoopNet
MonoRec Wimbauer 2021 자기지도 학습 단안 3D 재구성, 움직이는 객체
TANDEM Koestler 2021 MVS 깊이를 통한 실시간 추적 + 밀도 매핑, DSO 기반

학습 기반 SLAM 시스템

시스템 저자/연도 핵심 개념
DROID-SLAM Teed 2021 미분 가능 BA, 밀도 옵티컬 플로우, 종단간 학습
TartanVO Wang 2021 일반화 가능한 시각 오도메트리
DPV-SLAM Lipson 2024 DPVO + 루프 클로저, 완전한 SLAM (ECCV 2024)
MAC-VO Qiu 2024 학습 기반 VO, 메트릭 인식
VoT Yugay 2025 Transformer 기반 시각 오도메트리 (이후 FVO로 재명명)

잠재 표현 SLAM

시스템 저자/연도 핵심 개념
CodeSLAM Bloesch 2018 128차원 잠재 코드로서의 깊이, 코드 + 포즈에 대한 광도 BA
SceneCode Zhi 2019 단일 잠재 코드 내 깊이 + 시맨틱, 교차 모달 제약
DeepFactors Czarnowski 2020 확률적 깊이 코드 + 팩터 그래프, GPU에서 30+ FPS
NodeSLAM Sucar 2020 객체 수준 DeepSDF 코드, 객체별 점유 VAE
CodeMapping Matsuki 2021 희소 SLAM + 학습된 밀도 매핑, 하이브리드 접근법

신경 렌더링 (참조)

NeRF/3DGS 기반 SLAM 시스템 → 아래 E축 참고

시스템 저자/연도 핵심 개념
NeRF Mildenhall 2020 Neural Radiance Fields, 새로운 뷰 합성 (토대 논문)
DIFIX3D+ Wu 2025 3D 재구성 아티팩트 제거를 위한 단일 스텝 디퓨전 (후처리)

D. 장면 이해

벤치마크 및 기초

시스템 저자/연도 핵심 개념
EFM3D Straub (Meta) 2024 Egocentric Foundation Model 3D 벤치마크, 1인칭 비디오로부터의 깊이/표면/시맨틱

3D 장면 그래프

시스템 저자/연도 핵심 개념
Kimera / 3D Dynamic Scene Graph Rosinol 2020 Kimera-VIO, Kimera-Mesher, Kimera-PGMO, Kimera-Semantics, Kimera-DSG (스테레오/단안 시각-관성 파이프라인)
Hydra Hughes (MIT SPARK) 2022 실시간 계층적 장면 그래프 (메시→객체→장소→방→건물)
Hydra-Multi Chang 2023 분산 멀티로봇 3D 장면 그래프
Clio Maggio (MIT SPARK) 2024 오픈셋 작업 지향 장면 그래프, 노드별 CLIP 임베딩
Khronos Schmid (MIT SPARK) 2024 시공간 장면 그래프, 동적 객체 이력 추적
ConceptGraphs Gu 2023 오픈 어휘 3D 장면 그래프, SAM + CLIP + LLM 관계

의미론적 / 언어 기반 SLAM

시스템 저자/연도 핵심 개념
ConceptFusion Jatavallabhula (MIT) 2023 CLIP 특징을 3D 지도에 융합, 오픈 어휘 언어 질의
LERF Kerr 2023 언어가 내재된 래디언스 필드, DINO 멀티스케일, NeRF + CLIP
OpenScene Peng (ETH) 2023 언어 특징을 3D 포인트 클라우드로 역투영
SpatialLM Mao 2025 포인트 클라우드 → LLM, Python 스크립트로서의 구조화된 실내 모델링

참고: LEGS, OpenGS-SLAM (위의 E축); Open-YOLO 3D (레벨 5 객체 검출)

E. 파운데이션 모델 및 신경망 표현 SLAM

파운데이션 모델 SLAM

시스템 저자/연도 핵심 개념
DUSt3R Wang 2024 이미지 쌍으로부터 포인트맵 회귀, 캘리브레이션 불필요
MASt3R Leroy 2024 DUSt3R + 지역 특징 매칭
MASt3R-SLAM Murai 2024 MASt3R 사전 정보 기반 실시간 밀도 SLAM
VGGT Wang (Meta) 2025 N개 뷰로부터 포즈, 깊이, 포인트맵, 트랙을 피드포워드로 추론 (CVPR 2025 최우수 논문상)
VGGT-SLAM Maggio 2025 SL(4) 매니폴드 위에서 최적화된 밀도 RGB SLAM, VGGT 프론트엔드
VGGT-SLAM 2.0 Maggio 2026 실시간 밀도 피드포워드 장면 재구성
VGGT-Geo Qin 2026 밀도 실내 SLAM을 위한 VGGT 사전 정보의 확률적 기하 융합
IGGT Li 2025 인스턴스 기반 기하 Transformer — 통합 3D 재구성 + 인스턴스 수준 이해
AMB3R Wang 2025 백엔드를 갖춘 정확한 피드포워드 미터 스케일 3D 재구성, SfM/SLAM 지원
MASt3R-Fusion Zhou 2025 MASt3R 피드포워드 시각 모델 + IMU + GNSS 융합

NeRF 기반

시스템 저자/연도 핵심 개념
iMAP Sucar 2021 최초의 NeRF-SLAM, 단일 MLP, 실시간 추적/매핑
BARF Lin 2021 번들 조정 NeRF, 거친-세밀 위치 인코딩, 포즈+NeRF 공동 최적화 (완전한 SLAM은 아님 — 포즈+NeRF 공동 최적화)
NICE-SLAM Zhu & Peng 2022 계층적 특징 그리드(거침/중간/세밀), 확장 가능
Co-SLAM Wang 2023 해시 그리드(Instant-NGP) + 좌표 인코딩, NICE-SLAM보다 5~10배 빠름
ESLAM Johari 2023 트라이플레인 표현, O(N²) vs O(N³) 메모리
Point-SLAM Sandström 2023 신경망 포인트 클라우드 기반
NeRF-SLAM Rosinol 2023 NeRF + 고전적 SLAM 파이프라인
NICER-SLAM Zhu 2024 RGB 전용 NeRF-SLAM(깊이 센서 없음), 단안 깊이 통합
vMAP Kong 2023 객체 수준 NeRF-SLAM, 객체별 신경 필드
GO-SLAM Zhang 2023 전역 최적화 + NeRF-SLAM, 루프 클로저 + 전역 BA

3DGS 기반

시스템 저자/연도 핵심 개념
SplaTAM Keetha 2024 최초의 3DGS SLAM 시스템 중 하나(GS-SLAM, MonoGS와 동시기), RGB-D, 실루엣 기반 밀집화
MonoGS Matsuki 2024 최초의 단안 3DGS SLAM(CVPR 2024 하이라이트), 직접 래스터화 기반 추적, 해석적 카메라 야코비안
GS-ICP SLAM Ha 2024 가우시안-대-가우시안 ICP(마할라노비스 거리), 기하학적 추적
Photo-SLAM Huang 2024 명시적 기하 + 암시적 외관(MLP 색상), 안티앨리어싱
RTG-SLAM Peng 2024 실시간에 초점, 적응형 가우시안 예산, Jetson Orin에서 25 FPS
EGG-Fusion Pan 2025 즉석 기하 인식 가우시안 서펠 융합, 정보 필터 기반, 실시간
Online 3DGS Modeling Lee 2025 새로운 뷰 선택을 활용한 온라인 3D 가우시안 스플래팅 모델링
ActiveSplat Li 2025 3DGS + Voronoi 기반 경로 계획을 활용한 능동 매핑
OpenGS-SLAM Yang 2025 오픈셋 밀도 시맨틱 3DGS SLAM, 객체 수준 장면 이해
LEGS Yu 2024 언어가 내재된 가우시안 스플랫, 실시간 언어 질의 가능 3D