第 05 级 / 11

深度学习 + SLAM

学习型前端、可微分后端、端到端系统、基础模型与神经SLAM、场景理解

关键概念

第5级分为五大支柱: A. 前端 — 用学习型感知组件替代手工设计模块 B. 后端 — 用学习型/可证明最优的优化方法替代传统求解器 C. 系统 — 端到端深度VO/SLAM流水线 D. 场景理解 — 基于SLAM地图的语义、语言与关系推理 E. 基础模型与神经SLAM — 点图Transformer、基于NeRF与3DGS的稠密SLAM系统

A. 深度前端 — 感知

特征检测与匹配

系统 作者/年份 关键概念
NetVLAD Arandjelović 2016 VLAD、地点识别
SuperPoint DeTone 2017 单应自适应(Homographic Adaptation)、自监督、VGG编码器+检测器/描述子头
HardNet Mishchuk 2017 学习型局部描述子
R2D2 Revaud 2019 可重复且可靠的检测器/描述子,显式的重复性/可靠性图
KeyNet Barroso-Laguna 2019 学习型关键点检测器
HF-Net Sarlin 2019 全局特征、局部特征、视觉定位
SuperGlue Sarlin 2020 自注意力/交叉注意力图神经网络(GNN)、Sinkhorn最优分配、用于处理外点的垃圾箱(dustbin)
DISK Tyszkiewicz 2020 策略梯度(强化学习)训练,将匹配成功/失败作为奖励
Patch NetVLAD Hausler 2021 多尺度图像块级VLAD
LoFTR Sun 2021 无检测器(Detector-free)、Transformer由粗到精的稠密匹配
LightGlue Lindenberger 2023 自适应深度/宽度,比SuperGlue快5-10倍
XFeat Potje 2024 0.3M参数、1400 FPS(RTX 4090)、64维描述子,适合嵌入式设备
RoMa Edstedt 2024 DINOv2基础特征+由粗到精稠密匹配
DeDoDe Edstedt 2024 一阶段联合检测与描述
RoMa v2 Edstedt 2025 更难、更好、更快、更稠密的稠密特征匹配

深度估计

系统 作者/年份 关键概念
MonoDepth Godard 2016 左右光度一致性,自监督
MiDaS Ranftl 2020 多数据集混合训练、尺度与偏移不变损失、相对深度
DPT Ranftl 2021 稠密预测Transformer(ViT骨干网络),全局上下文
ZoeDepth Bhat 2023 零样本度量深度、度量分箱模块(Metric Bins Module)
Metric3D Yin 2023 基于相机内参条件的度量深度、规范相机空间(Canonical Camera Space)
Depth Anything Yang 2024 6200万张图像、单目深度基础模型
Depth Anything V2 Yang 2024 使用合成数据改进,边缘保持效果更佳
Depth Anything 3 Lin 2025 从任意输入恢复任意视角几何,深度-光线预测目标,单一普通Transformer(DINOv2),师生训练
Marigold Ke 2024 用Stable Diffusion做深度估计,细节丰富,通过采样获得不确定性
Align3R Lu 2025 视频时序一致性,基于DUSt3R,CVPR 2025 Highlight
Masked Depth Modeling (LingBot-Depth) Tan 2026 修复了RGB-D在玻璃/镜面/金属材质上的失效问题

光流与场景流

系统 作者/年份 关键概念
FlowNet Dosovitskiy 2015 首个端到端深度光流网络(SimpleNet / CorrNet)
FlowNet 2.0 Ilg 2017 堆叠网络,达到传统方法级别的精度
PWC-Net Sun 2018 金字塔-变形-代价体(Pyramid-Warping-Cost volume),由粗到精,840万参数
FlowNet3D Liu 2019 点云场景流,基于PointNet++
RAFT Teed 2020 全局对关联(All-Pairs Correlation)+迭代ConvGRU更新,ECCV最佳论文
RAFT-3D Teed 2021 基于RAFT的场景流(3D运动)
FlowFormer Huang 2022 在代价体token上应用Transformer,全局上下文
SEA-RAFT Wang 2024 面向实时应用的高效RAFT变体

相机位姿回归与重定位

系统 作者/年份 关键概念
PoseNet Kendall 2015 基于CNN的6自由度位姿回归(APR),GoogLeNet骨干网络
DSAC Brachmann 2017 可微分RANSAC,场景坐标回归(SCR)
DSAC++ Brachmann 2018 自监督,支持RGB-D
CNN位姿回归的局限性 Sattler 2019 位姿回归性能≈图像检索性能
LM-Reloc von Stumberg 2020 深度直接法重定位
DSAC* Brachmann 2021 基于RGB/RGB-D的视觉重定位,改进了学习稳定性(TPAMI)
ACE Brachmann 2023 加速坐标编码(Accelerated Coordinate Encoding),每场景仅需5分钟训练
ACE Zero Brachmann 2024 零样本SCR,不需要预先构建3D地图
ACE-G Bruns 2025 通过查询预训练实现可泛化SCR,新场景无需微调
ACE-SLAM Alzugaray 2025 神经隐式实时SLAM,网络权重即地图
hloc Sarlin 2019 实现HF-Net层次化定位思想的工具箱: 粗定位(NetVLAD)→精定位(SuperGlue)

面向SLAM的物体检测与分割

系统 作者/年份 关键概念
YOLO(v1→v11) Redmon 2016→2024 实时物体检测,Ultralytics生态系统
DETR Carion 2020 Transformer检测,无锚框(anchor-free),无需NMS
RT-DETR Zhao (Baidu) 2023 实时DETR,兼具YOLO的速度与Transformer的质量
RF-DETR Robinson 2025 面向DETR的权重共享NAS,精度-延迟帕累托调优,首个在COCO上突破60 AP的实时检测器
SAM Kirillov 2023 Segment Anything,基于提示,基础模型
SAM 2 Meta 2024 视频分割,记忆注意力(Memory Attention),时序一致性
SAM 3 Carion 2025 可提示概念分割(名词短语/样例提示),存在性头,检测器+基于记忆的视频跟踪器
Grounding DINO Liu 2023 文本提示检测→SAM流水线(Grounded SAM)
Open-YOLO 3D Boudjoghra 2024 2D开放词汇检测→3D实例分割,速度提升16倍

B. 深度后端 — 优化

可微分光束法平差

系统 作者/年份 关键概念
BA-Net Tang 2019 FPN+可微分LM层,端到端SfM(ICLR)
DROID-SLAM Teed 2021 稠密光流+可微分稠密BA,全像素重投影
DPVO Teed 2023 基于图像块的轻量化DROID-SLAM,30+ FPS实时
Theseus Pineda (Meta) 2022 可微分非线性优化库(PyTorch)
Lietorch Teed 2021 面向PyTorch的李群运算(SE(3)/SO(3))

C. 端到端深度VO/SLAM系统

自监督与学习型VO

系统 作者/年份 关键概念
DeepVO Wang 2017 有监督学习
SfM-Learner Zhou 2017 无监督,深度深度估计+深度位姿估计
DeMoN Ummenhofer 2017 从两帧中估计深度+运动,编码器-解码器结构
UndeepVO Li 2018 立体自监督,绝对尺度恢复
DeepTAM Zhou 2018 深度跟踪与建图,基于代价体
DeepV2D Teed 2018 从视频中迭代估计深度,可微分几何层
Depth from Videos in the Wild Gordon 2019 无约束视频深度估计,学习型相机内参
Neural Ray Surfaces Vasiljevic 2020 学习型光线表面模型,非针孔相机
GradSLAM Murthy 2020 可微分SLAM框架(PyTorch,支持多种SLAM后端)
DeepSLAM Li 2020 TrackingNet、MappingNet、LoopNet
MonoRec Wimbauer 2021 自监督单目3D重建,运动物体处理
TANDEM Koestler 2021 通过MVS深度实现实时跟踪+稠密建图,基于DSO

基于学习的SLAM系统

系统 作者/年份 关键概念
DROID-SLAM Teed 2021 可微分BA、稠密光流、端到端学习
TartanVO Wang 2021 可泛化的视觉里程计
DPV-SLAM Lipson 2024 DPVO+回环检测,完整SLAM(ECCV 2024)
MAC-VO Qiu 2024 基于学习的VO,度量感知(metric-aware)
VoT Yugay 2025 基于Transformer的视觉里程计(后改名为FVO)

潜表征SLAM

系统 作者/年份 关键概念
CodeSLAM Bloesch 2018 深度表示为128维潜编码,在编码+位姿上进行光度BA
SceneCode Zhi 2019 深度+语义共享单一潜编码,跨模态约束
DeepFactors Czarnowski 2020 概率深度编码+因子图,GPU上30+ FPS
NodeSLAM Sucar 2020 物体级DeepSDF编码,逐物体占据VAE
CodeMapping Matsuki 2021 稀疏SLAM+学习型稠密建图,混合方法

神经渲染(参考)

基于NeRF/3DGS的SLAM系统 → 见下文支柱E

系统 作者/年份 关键概念
NeRF Mildenhall 2020 神经辐射场,新视角合成(奠基性工作)
DIFIX3D+ Wu 2025 单步扩散模型用于3D重建伪影去除(后处理)

D. 场景理解

基准与基础

系统 作者/年份 关键概念
EFM3D Straub (Meta) 2024 第一人称视角基础模型3D基准,从第一人称视频中提取深度/表面/语义

3D场景图

系统 作者/年份 关键概念
Kimera / 3D动态场景图 Rosinol 2020 Kimera-VIO、Kimera-Mesher、Kimera-PGMO、Kimera-Semantics、Kimera-DSG(立体/单目视觉惯性流水线)
Hydra Hughes (MIT SPARK) 2022 实时分层场景图(网格→物体→区域→房间→建筑)
Hydra-Multi Chang 2023 分布式多机器人3D场景图
Clio Maggio (MIT SPARK) 2024 开放集任务驱动场景图,每节点带CLIP嵌入
Khronos Schmid (MIT SPARK) 2024 时空场景图,动态物体历史跟踪
ConceptGraphs Gu 2023 开放词汇3D场景图,SAM+CLIP+LLM关系推理

语义/语言引导SLAM

系统 作者/年份 关键概念
ConceptFusion Jatavallabhula (MIT) 2023 CLIP特征融合进3D地图,开放词汇语言查询
LERF Kerr 2023 语言嵌入辐射场(Language Embedded Radiance Fields),DINO多尺度特征,NeRF+CLIP
OpenScene Peng (ETH) 2023 语言特征反投影到3D点云
SpatialLM Mao 2025 点云→LLM,将结构化室内建模表示为Python脚本

另见: LEGSOpenGS-SLAM(见上文支柱E);Open-YOLO 3D(第5级 物体检测)

E. 基础模型与神经表征SLAM

基础模型SLAM

系统 作者/年份 关键概念
DUSt3R Wang 2024 从图像对回归点图(Pointmap),无需标定
MASt3R Leroy 2024 DUSt3R+局部特征匹配
MASt3R-SLAM Murai 2024 基于MASt3R先验的实时稠密SLAM
VGGT Wang (Meta) 2025 从N个视角前馈推断位姿、深度、点图、轨迹(CVPR 2025最佳论文)
VGGT-SLAM Maggio 2025 在SL(4)流形上优化的稠密RGB SLAM,VGGT前端
VGGT-SLAM 2.0 Maggio 2026 实时稠密前馈场景重建
VGGT-Geo Qin 2026 对VGGT先验进行概率几何融合,用于稠密室内SLAM
IGGT Li 2025 实例基础几何Transformer(Instance-grounded geometry transformer) — 统一3D重建与实例级理解
AMB3R Wang 2025 带后端的高精度前馈度量尺度3D重建,支持SfM/SLAM
MASt3R-Fusion Zhou 2025 MASt3R前馈视觉模型+IMU+GNSS融合

基于NeRF

系统 作者/年份 关键概念
iMAP Sucar 2021 首个NeRF-SLAM,单一MLP,实时跟踪/建图
BARF Lin 2021 光束法平差式NeRF(Bundle-Adjusting NeRF),由粗到精的位置编码,位姿与NeRF联合优化(非完整SLAM — 仅位姿+NeRF联合优化)
NICE-SLAM Zhu & Peng 2022 分层特征网格(粗/中/细),可扩展
Co-SLAM Wang 2023 哈希网格(Instant-NGP)+坐标编码,比NICE-SLAM快5-10倍
ESLAM Johari 2023 三平面表征,O(N²)对比O(N³)的内存占用
Point-SLAM Sandström 2023 基于神经点云
NeRF-SLAM Rosinol 2023 NeRF+传统SLAM流水线
NICER-SLAM Zhu 2024 仅RGB的NeRF-SLAM(无深度传感器),融合单目深度估计
vMAP Kong 2023 物体级NeRF-SLAM,逐物体神经场
GO-SLAM Zhang 2023 全局优化+NeRF-SLAM,回环检测+全局BA

基于3DGS

系统 作者/年份 关键概念
SplaTAM Keetha 2024 最早的3DGS SLAM系统之一(与GS-SLAM、MonoGS同期),RGB-D,基于轮廓引导的稠密化
MonoGS Matsuki 2024 首个单目3DGS SLAM(CVPR 2024 highlight),基于直接光栅化的跟踪,解析相机雅可比矩阵
GS-ICP SLAM Ha 2024 高斯到高斯ICP(马氏距离),几何跟踪
Photo-SLAM Huang 2024 显式几何+隐式外观(MLP颜色),抗锯齿
RTG-SLAM Peng 2024 专注实时性,自适应高斯预算,Jetson Orin上25 FPS
EGG-Fusion Pan 2025 在线几何感知高斯面元融合,基于信息滤波器,实时
Online 3DGS Modeling Lee 2025 具备新视角选择的在线3D高斯溅射建模
ActiveSplat Li 2025 结合3DGS与基于Voronoi的路径规划的主动建图
OpenGS-SLAM Yang 2025 开放集稠密语义3DGS SLAM,物体级场景理解
LEGS Yu 2024 语言嵌入高斯溅射(Language Embedded Gaussian Splats),实时语言可查询的3D场景