关键概念
- 学习型方法与手工设计方法 — 用网络替换单个传统模块(特征、深度、匹配) 对比 端到端学习
- 可微分性 — 使传统优化方法(RANSAC、BA)可微分,从而能够进行端到端训练
- 基础模型 — 大型预训练模型(CLIP、SAM、DUSt3R系列)作为可复用的感知骨干网络
第5级分为五大支柱: A. 前端 — 用学习型感知组件替代手工设计模块 B. 后端 — 用学习型/可证明最优的优化方法替代传统求解器 C. 系统 — 端到端深度VO/SLAM流水线 D. 场景理解 — 基于SLAM地图的语义、语言与关系推理 E. 基础模型与神经SLAM — 点图Transformer、基于NeRF与3DGS的稠密SLAM系统
A. 深度前端 — 感知
特征检测与匹配
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| NetVLAD | Arandjelović 2016 | VLAD、地点识别 |
| SuperPoint | DeTone 2017 | 单应自适应(Homographic Adaptation)、自监督、VGG编码器+检测器/描述子头 |
| HardNet | Mishchuk 2017 | 学习型局部描述子 |
| R2D2 | Revaud 2019 | 可重复且可靠的检测器/描述子,显式的重复性/可靠性图 |
| KeyNet | Barroso-Laguna 2019 | 学习型关键点检测器 |
| HF-Net | Sarlin 2019 | 全局特征、局部特征、视觉定位 |
| SuperGlue | Sarlin 2020 | 自注意力/交叉注意力图神经网络(GNN)、Sinkhorn最优分配、用于处理外点的垃圾箱(dustbin) |
| DISK | Tyszkiewicz 2020 | 策略梯度(强化学习)训练,将匹配成功/失败作为奖励 |
| Patch NetVLAD | Hausler 2021 | 多尺度图像块级VLAD |
| LoFTR | Sun 2021 | 无检测器(Detector-free)、Transformer由粗到精的稠密匹配 |
| LightGlue | Lindenberger 2023 | 自适应深度/宽度,比SuperGlue快5-10倍 |
| XFeat | Potje 2024 | 0.3M参数、1400 FPS(RTX 4090)、64维描述子,适合嵌入式设备 |
| RoMa | Edstedt 2024 | DINOv2基础特征+由粗到精稠密匹配 |
| DeDoDe | Edstedt 2024 | 一阶段联合检测与描述 |
| RoMa v2 | Edstedt 2025 | 更难、更好、更快、更稠密的稠密特征匹配 |
深度估计
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| MonoDepth | Godard 2016 | 左右光度一致性,自监督 |
| MiDaS | Ranftl 2020 | 多数据集混合训练、尺度与偏移不变损失、相对深度 |
| DPT | Ranftl 2021 | 稠密预测Transformer(ViT骨干网络),全局上下文 |
| ZoeDepth | Bhat 2023 | 零样本度量深度、度量分箱模块(Metric Bins Module) |
| Metric3D | Yin 2023 | 基于相机内参条件的度量深度、规范相机空间(Canonical Camera Space) |
| Depth Anything | Yang 2024 | 6200万张图像、单目深度基础模型 |
| Depth Anything V2 | Yang 2024 | 使用合成数据改进,边缘保持效果更佳 |
| Depth Anything 3 | Lin 2025 | 从任意输入恢复任意视角几何,深度-光线预测目标,单一普通Transformer(DINOv2),师生训练 |
| Marigold | Ke 2024 | 用Stable Diffusion做深度估计,细节丰富,通过采样获得不确定性 |
| Align3R | Lu 2025 | 视频时序一致性,基于DUSt3R,CVPR 2025 Highlight |
| Masked Depth Modeling (LingBot-Depth) | Tan 2026 | 修复了RGB-D在玻璃/镜面/金属材质上的失效问题 |
光流与场景流
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| FlowNet | Dosovitskiy 2015 | 首个端到端深度光流网络(SimpleNet / CorrNet) |
| FlowNet 2.0 | Ilg 2017 | 堆叠网络,达到传统方法级别的精度 |
| PWC-Net | Sun 2018 | 金字塔-变形-代价体(Pyramid-Warping-Cost volume),由粗到精,840万参数 |
| FlowNet3D | Liu 2019 | 点云场景流,基于PointNet++ |
| RAFT | Teed 2020 | 全局对关联(All-Pairs Correlation)+迭代ConvGRU更新,ECCV最佳论文 |
| RAFT-3D | Teed 2021 | 基于RAFT的场景流(3D运动) |
| FlowFormer | Huang 2022 | 在代价体token上应用Transformer,全局上下文 |
| SEA-RAFT | Wang 2024 | 面向实时应用的高效RAFT变体 |
相机位姿回归与重定位
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| PoseNet | Kendall 2015 | 基于CNN的6自由度位姿回归(APR),GoogLeNet骨干网络 |
| DSAC | Brachmann 2017 | 可微分RANSAC,场景坐标回归(SCR) |
| DSAC++ | Brachmann 2018 | 自监督,支持RGB-D |
| CNN位姿回归的局限性 | Sattler 2019 | 位姿回归性能≈图像检索性能 |
| LM-Reloc | von Stumberg 2020 | 深度直接法重定位 |
| DSAC* | Brachmann 2021 | 基于RGB/RGB-D的视觉重定位,改进了学习稳定性(TPAMI) |
| ACE | Brachmann 2023 | 加速坐标编码(Accelerated Coordinate Encoding),每场景仅需5分钟训练 |
| ACE Zero | Brachmann 2024 | 零样本SCR,不需要预先构建3D地图 |
| ACE-G | Bruns 2025 | 通过查询预训练实现可泛化SCR,新场景无需微调 |
| ACE-SLAM | Alzugaray 2025 | 神经隐式实时SLAM,网络权重即地图 |
| hloc | Sarlin 2019 | 实现HF-Net层次化定位思想的工具箱: 粗定位(NetVLAD)→精定位(SuperGlue) |
面向SLAM的物体检测与分割
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| YOLO(v1→v11) | Redmon 2016→2024 | 实时物体检测,Ultralytics生态系统 |
| DETR | Carion 2020 | Transformer检测,无锚框(anchor-free),无需NMS |
| RT-DETR | Zhao (Baidu) 2023 | 实时DETR,兼具YOLO的速度与Transformer的质量 |
| RF-DETR | Robinson 2025 | 面向DETR的权重共享NAS,精度-延迟帕累托调优,首个在COCO上突破60 AP的实时检测器 |
| SAM | Kirillov 2023 | Segment Anything,基于提示,基础模型 |
| SAM 2 | Meta 2024 | 视频分割,记忆注意力(Memory Attention),时序一致性 |
| SAM 3 | Carion 2025 | 可提示概念分割(名词短语/样例提示),存在性头,检测器+基于记忆的视频跟踪器 |
| Grounding DINO | Liu 2023 | 文本提示检测→SAM流水线(Grounded SAM) |
| Open-YOLO 3D | Boudjoghra 2024 | 2D开放词汇检测→3D实例分割,速度提升16倍 |
B. 深度后端 — 优化
可微分光束法平差
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| BA-Net | Tang 2019 | FPN+可微分LM层,端到端SfM(ICLR) |
| DROID-SLAM | Teed 2021 | 稠密光流+可微分稠密BA,全像素重投影 |
| DPVO | Teed 2023 | 基于图像块的轻量化DROID-SLAM,30+ FPS实时 |
| Theseus | Pineda (Meta) 2022 | 可微分非线性优化库(PyTorch) |
| Lietorch | Teed 2021 | 面向PyTorch的李群运算(SE(3)/SO(3)) |
C. 端到端深度VO/SLAM系统
自监督与学习型VO
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| DeepVO | Wang 2017 | 有监督学习 |
| SfM-Learner | Zhou 2017 | 无监督,深度深度估计+深度位姿估计 |
| DeMoN | Ummenhofer 2017 | 从两帧中估计深度+运动,编码器-解码器结构 |
| UndeepVO | Li 2018 | 立体自监督,绝对尺度恢复 |
| DeepTAM | Zhou 2018 | 深度跟踪与建图,基于代价体 |
| DeepV2D | Teed 2018 | 从视频中迭代估计深度,可微分几何层 |
| Depth from Videos in the Wild | Gordon 2019 | 无约束视频深度估计,学习型相机内参 |
| Neural Ray Surfaces | Vasiljevic 2020 | 学习型光线表面模型,非针孔相机 |
| GradSLAM | Murthy 2020 | 可微分SLAM框架(PyTorch,支持多种SLAM后端) |
| DeepSLAM | Li 2020 | TrackingNet、MappingNet、LoopNet |
| MonoRec | Wimbauer 2021 | 自监督单目3D重建,运动物体处理 |
| TANDEM | Koestler 2021 | 通过MVS深度实现实时跟踪+稠密建图,基于DSO |
基于学习的SLAM系统
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| DROID-SLAM | Teed 2021 | 可微分BA、稠密光流、端到端学习 |
| TartanVO | Wang 2021 | 可泛化的视觉里程计 |
| DPV-SLAM | Lipson 2024 | DPVO+回环检测,完整SLAM(ECCV 2024) |
| MAC-VO | Qiu 2024 | 基于学习的VO,度量感知(metric-aware) |
| VoT | Yugay 2025 | 基于Transformer的视觉里程计(后改名为FVO) |
潜表征SLAM
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| CodeSLAM | Bloesch 2018 | 深度表示为128维潜编码,在编码+位姿上进行光度BA |
| SceneCode | Zhi 2019 | 深度+语义共享单一潜编码,跨模态约束 |
| DeepFactors | Czarnowski 2020 | 概率深度编码+因子图,GPU上30+ FPS |
| NodeSLAM | Sucar 2020 | 物体级DeepSDF编码,逐物体占据VAE |
| CodeMapping | Matsuki 2021 | 稀疏SLAM+学习型稠密建图,混合方法 |
神经渲染(参考)
基于NeRF/3DGS的SLAM系统 → 见下文支柱E
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| NeRF | Mildenhall 2020 | 神经辐射场,新视角合成(奠基性工作) |
| DIFIX3D+ | Wu 2025 | 单步扩散模型用于3D重建伪影去除(后处理) |
D. 场景理解
基准与基础
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| EFM3D | Straub (Meta) 2024 | 第一人称视角基础模型3D基准,从第一人称视频中提取深度/表面/语义 |
3D场景图
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| Kimera / 3D动态场景图 | Rosinol 2020 | Kimera-VIO、Kimera-Mesher、Kimera-PGMO、Kimera-Semantics、Kimera-DSG(立体/单目视觉惯性流水线) |
| Hydra | Hughes (MIT SPARK) 2022 | 实时分层场景图(网格→物体→区域→房间→建筑) |
| Hydra-Multi | Chang 2023 | 分布式多机器人3D场景图 |
| Clio | Maggio (MIT SPARK) 2024 | 开放集任务驱动场景图,每节点带CLIP嵌入 |
| Khronos | Schmid (MIT SPARK) 2024 | 时空场景图,动态物体历史跟踪 |
| ConceptGraphs | Gu 2023 | 开放词汇3D场景图,SAM+CLIP+LLM关系推理 |
语义/语言引导SLAM
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| ConceptFusion | Jatavallabhula (MIT) 2023 | CLIP特征融合进3D地图,开放词汇语言查询 |
| LERF | Kerr 2023 | 语言嵌入辐射场(Language Embedded Radiance Fields),DINO多尺度特征,NeRF+CLIP |
| OpenScene | Peng (ETH) 2023 | 语言特征反投影到3D点云 |
| SpatialLM | Mao 2025 | 点云→LLM,将结构化室内建模表示为Python脚本 |
另见: LEGS、OpenGS-SLAM(见上文支柱E);Open-YOLO 3D(第5级 物体检测)
E. 基础模型与神经表征SLAM
基础模型SLAM
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| DUSt3R | Wang 2024 | 从图像对回归点图(Pointmap),无需标定 |
| MASt3R | Leroy 2024 | DUSt3R+局部特征匹配 |
| MASt3R-SLAM | Murai 2024 | 基于MASt3R先验的实时稠密SLAM |
| VGGT | Wang (Meta) 2025 | 从N个视角前馈推断位姿、深度、点图、轨迹(CVPR 2025最佳论文) |
| VGGT-SLAM | Maggio 2025 | 在SL(4)流形上优化的稠密RGB SLAM,VGGT前端 |
| VGGT-SLAM 2.0 | Maggio 2026 | 实时稠密前馈场景重建 |
| VGGT-Geo | Qin 2026 | 对VGGT先验进行概率几何融合,用于稠密室内SLAM |
| IGGT | Li 2025 | 实例基础几何Transformer(Instance-grounded geometry transformer) — 统一3D重建与实例级理解 |
| AMB3R | Wang 2025 | 带后端的高精度前馈度量尺度3D重建,支持SfM/SLAM |
| MASt3R-Fusion | Zhou 2025 | MASt3R前馈视觉模型+IMU+GNSS融合 |
基于NeRF
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| iMAP | Sucar 2021 | 首个NeRF-SLAM,单一MLP,实时跟踪/建图 |
| BARF | Lin 2021 | 光束法平差式NeRF(Bundle-Adjusting NeRF),由粗到精的位置编码,位姿与NeRF联合优化(非完整SLAM — 仅位姿+NeRF联合优化) |
| NICE-SLAM | Zhu & Peng 2022 | 分层特征网格(粗/中/细),可扩展 |
| Co-SLAM | Wang 2023 | 哈希网格(Instant-NGP)+坐标编码,比NICE-SLAM快5-10倍 |
| ESLAM | Johari 2023 | 三平面表征,O(N²)对比O(N³)的内存占用 |
| Point-SLAM | Sandström 2023 | 基于神经点云 |
| NeRF-SLAM | Rosinol 2023 | NeRF+传统SLAM流水线 |
| NICER-SLAM | Zhu 2024 | 仅RGB的NeRF-SLAM(无深度传感器),融合单目深度估计 |
| vMAP | Kong 2023 | 物体级NeRF-SLAM,逐物体神经场 |
| GO-SLAM | Zhang 2023 | 全局优化+NeRF-SLAM,回环检测+全局BA |
基于3DGS
| 系统 | 作者/年份 | 关键概念 |
|---|---|---|
| SplaTAM | Keetha 2024 | 最早的3DGS SLAM系统之一(与GS-SLAM、MonoGS同期),RGB-D,基于轮廓引导的稠密化 |
| MonoGS | Matsuki 2024 | 首个单目3DGS SLAM(CVPR 2024 highlight),基于直接光栅化的跟踪,解析相机雅可比矩阵 |
| GS-ICP SLAM | Ha 2024 | 高斯到高斯ICP(马氏距离),几何跟踪 |
| Photo-SLAM | Huang 2024 | 显式几何+隐式外观(MLP颜色),抗锯齿 |
| RTG-SLAM | Peng 2024 | 专注实时性,自适应高斯预算,Jetson Orin上25 FPS |
| EGG-Fusion | Pan 2025 | 在线几何感知高斯面元融合,基于信息滤波器,实时 |
| Online 3DGS Modeling | Lee 2025 | 具备新视角选择的在线3D高斯溅射建模 |
| ActiveSplat | Li 2025 | 结合3DGS与基于Voronoi的路径规划的主动建图 |
| OpenGS-SLAM | Yang 2025 | 开放集稠密语义3DGS SLAM,物体级场景理解 |
| LEGS | Yu 2024 | 语言嵌入高斯溅射(Language Embedded Gaussian Splats),实时语言可查询的3D场景 |