レベル 05 / 11

深層学習+SLAM

学習ベースのフロントエンド、微分可能なバックエンド、end-to-endシステム、基盤モデル・ニューラルSLAM、シーン理解

キーコンセプト

Level 5は5つの柱で構成される: A. フロントエンド — 手作りモジュールを置き換える学習ベースの知覚コンポーネント B. バックエンド — 古典的ソルバーを置き換える学習/certifiable(証明可能)な最適化 C. システム — end-to-endな深層VO/SLAMパイプライン D. シーン理解 — SLAM地図上でのセマンティック・言語・関係推論 E. 基盤モデル・ニューラルSLAM — ポイントマップTransformer、NeRFおよび3DGSベースの高密度SLAMシステム

A. 深層フロントエンド — 知覚

特徴点検出とマッチング

システム 著者/年 キーコンセプト
NetVLAD Arandjelović 2016 VLAD、場所認識
SuperPoint DeTone 2017 Homographic Adaptation、自己教師あり、VGGエンコーダ+検出器/記述子ヘッド
HardNet Mishchuk 2017 学習されたローカル記述子
R2D2 Revaud 2019 再現性と信頼性を備えた検出器/記述子、明示的な再現性/信頼性マップ
KeyNet Barroso-Laguna 2019 学習された特徴点検出器
HF-Net Sarlin 2019 グローバル特徴、ローカル特徴、視覚的位置推定
SuperGlue Sarlin 2020 Self/Cross-attention GNN、Sinkhornによる最適割当、外れ値のためのdustbin
DISK Tyszkiewicz 2020 ポリシー勾配(強化学習)による学習、マッチの成否を報酬として利用
Patch NetVLAD Hausler 2021 マルチスケールなパッチレベルVLAD
LoFTR Sun 2021 検出器不要、Transformerによるcoarse-to-fineの高密度マッチング
LightGlue Lindenberger 2023 適応的な深さ/幅、SuperGlueより5〜10倍高速
XFeat Potje 2024 0.3Mパラメータ、1400FPS(RTX 4090)、64次元記述子、組込み向け
RoMa Edstedt 2024 DINOv2基盤特徴+coarse-to-fineの高密度マッチング
DeDoDe Edstedt 2024 検出と記述を単一段で同時に行う
RoMa v2 Edstedt 2025 より難しく・より良く・より速く・より密な高密度特徴マッチング

深度推定

システム 著者/年 キーコンセプト
MonoDepth Godard 2016 左右画像間の輝度一貫性、自己教師あり
MiDaS Ranftl 2020 複数データセットの混合学習、スケール・シフト不変な損失、相対深度
DPT Ranftl 2021 Dense Prediction Transformer(ViTバックボーン)、グローバルコンテキスト
ZoeDepth Bhat 2023 ゼロショットのメトリック深度、Metric Bins Module
Metric3D Yin 2023 カメラ内部パラメータを条件としたメトリック深度、Canonical Camera Space
Depth Anything Yang 2024 6200万枚の画像、モノキュラ深度のための基盤モデル
Depth Anything V2 Yang 2024 合成データによる改善、エッジ保存性の向上
Depth Anything 3 Lin 2025 任意の入力からの任意ビュー幾何、深度・レイ予測ターゲット、単一のプレーンなTransformer(DINOv2)、教師-生徒学習
Marigold Ke 2024 深度推定のためのStable Diffusion、細部の再現、サンプリングによる不確実性推定
Align3R Lu 2025 動画の時間的一貫性、DUSt3Rベース、CVPR 2025 Highlight
Masked Depth Modeling (LingBot-Depth) Tan 2026 ガラス・鏡・金属でのRGB-D失敗を修正

オプティカルフローとシーンフロー

システム 著者/年 キーコンセプト
FlowNet Dosovitskiy 2015 初のend-to-endな深層オプティカルフロー(SimpleNet / CorrNet)
FlowNet 2.0 Ilg 2017 スタック型ネットワーク、古典手法並みの精度
PWC-Net Sun 2018 Pyramid-Warping-Costボリューム、coarse-to-fine、840万パラメータ
FlowNet3D Liu 2019 点群シーンフロー、PointNet++ベース
RAFT Teed 2020 All-Pairs Correlation+反復的ConvGRU更新、ECCV最優秀論文
RAFT-3D Teed 2021 RAFTによるシーンフロー(3次元運動)
FlowFormer Huang 2022 コストボリュームトークン上のTransformer、グローバルコンテキスト
SEA-RAFT Wang 2024 リアルタイム向けの効率的なRAFT派生

カメラ姿勢回帰とリローカリゼーション

システム 著者/年 キーコンセプト
PoseNet Kendall 2015 CNNベースの6自由度姿勢回帰(APR)、GoogLeNetバックボーン
DSAC Brachmann 2017 微分可能なRANSAC、シーン座標回帰(SCR)
DSAC++ Brachmann 2018 自己教師あり、RGB-D対応
CNN Pose Regression Limitations Sattler 2019 姿勢回帰の性能は画像検索の性能とほぼ同等
LM-Reloc von Stumberg 2020 深層学習による直接リローカリゼーション
DSAC* Brachmann 2021 RGB/RGB-Dからの視覚的リローカリゼーション、学習の安定性を改善(TPAMI)
ACE Brachmann 2023 Accelerated Coordinate Encoding、シーンあたり5分の学習
ACE Zero Brachmann 2024 ゼロショットSCR、事前構築済み3次元地図が不要
ACE-G Bruns 2025 クエリの事前学習による汎化可能なSCR、ファインチューニングなしで新規シーンに対応
ACE-SLAM Alzugaray 2025 ニューラル陰関数によるリアルタイムSLAM、ネットワークの重み=地図
hloc Sarlin 2019 HF-Netの階層的位置推定(粗い(NetVLAD)→精密(SuperGlue))を実装したツールボックス

SLAMのための物体検出とセグメンテーション

システム 著者/年 キーコンセプト
YOLO (v1→v11) Redmon 2016→2024 リアルタイム物体検出、Ultralyticsエコシステム
DETR Carion 2020 Transformerによる検出、アンカーフリー、NMS不要
RT-DETR Zhao (Baidu) 2023 リアルタイムDETR、YOLOの速度+Transformerの精度
RF-DETR Robinson 2025 DETRに対する重み共有NAS、精度-レイテンシのParetoチューニング、COCOで60 APを超えた初のリアルタイム検出器
SAM Kirillov 2023 Segment Anything、プロンプトベース、基盤モデル
SAM 2 Meta 2024 動画セグメンテーション、Memory Attention、時間的一貫性
SAM 3 Carion 2025 プロンプト可能な概念セグメンテーション(名詞句/エグザンプラプロンプト)、プレゼンスヘッド、検出器+メモリベースの動画トラッカー
Grounding DINO Liu 2023 テキストプロンプトによる検出→SAMパイプライン(Grounded SAM)
Open-YOLO 3D Boudjoghra 2024 2Dオープンボキャブラリ検出→3Dインスタンスセグメンテーション、16倍高速

B. 深層バックエンド — 最適化

微分可能バンドル調整

システム 著者/年 キーコンセプト
BA-Net Tang 2019 FPN+微分可能なLM層、end-to-endなSfM(ICLR)
DROID-SLAM Teed 2021 高密度オプティカルフロー+微分可能な高密度BA、全画素の再投影
DPVO Teed 2023 パッチベースのDROID-SLAM、30FPS以上のリアルタイム動作
Theseus Pineda (Meta) 2022 微分可能な非線形最適化ライブラリ(PyTorch)
Lietorch Teed 2021 PyTorch向けのリー群演算(SE(3)/SO(3))

C. End-to-Endな深層VO/SLAMシステム

自己教師あり・学習ベースVO

システム 著者/年 キーコンセプト
DeepVO Wang 2017 教師あり学習
SfM-Learner Zhou 2017 教師なし、深層深度+深層姿勢
DeMoN Ummenhofer 2017 2フレームからの深度+運動、エンコーダ・デコーダ
UndeepVO Li 2018 ステレオによる自己教師あり、絶対スケールの復元
DeepTAM Zhou 2018 深層学習によるトラッキングとマッピング、コストボリュームベース
DeepV2D Teed 2018 動画からの反復的深度推定、微分可能な幾何層
Depth from Videos in the Wild Gordon 2019 制約のない動画からの深度推定、学習されたカメラ内部パラメータ
Neural Ray Surfaces Vasiljevic 2020 学習されたレイサーフェスモデル、非ピンホールカメラ
GradSLAM Murthy 2020 微分可能なSLAMフレームワーク(PyTorch、複数のSLAMバックエンドに対応)
DeepSLAM Li 2020 TrackingNet、MappingNet、LoopNet
MonoRec Wimbauer 2021 自己教師ありモノキュラ3次元再構成、移動物体対応
TANDEM Koestler 2021 MVS深度によるリアルタイムトラッキング+高密度マッピング、DSOベース

学習ベースSLAMシステム

システム 著者/年 キーコンセプト
DROID-SLAM Teed 2021 微分可能なBA、高密度オプティカルフロー、end-to-endで学習
TartanVO Wang 2021 汎化性の高いビジュアルオドメトリ
DPV-SLAM Lipson 2024 DPVO+ループクロージング、完全なSLAM(ECCV 2024)
MAC-VO Qiu 2024 学習ベースVO、メトリックスケールを考慮
VoT Yugay 2025 Transformerを用いたビジュアルオドメトリ(後にFVOへ改題)

潜在表現SLAM

システム 著者/年 キーコンセプト
CodeSLAM Bloesch 2018 深度を128次元の潜在コードとして表現、コードと姿勢に対する輝度BA
SceneCode Zhi 2019 深度とセマンティックを単一の潜在コードで表現、モダリティ間の制約
DeepFactors Czarnowski 2020 確率的な深度コード+ファクターグラフ、GPUで30FPS以上
NodeSLAM Sucar 2020 物体レベルのDeepSDFコード、物体ごとのoccupancy VAE
CodeMapping Matsuki 2021 疎なSLAM+学習ベースの高密度マッピング、ハイブリッドアプローチ

ニューラルレンダリング(参考)

NeRF/3DGSベースのSLAMシステム → 以下の柱Eを参照

システム 著者/年 キーコンセプト
NeRF Mildenhall 2020 Neural Radiance Fields、新規視点合成(基礎的研究)
DIFIX3D+ Wu 2025 3次元再構成のアーティファクト除去のための単一ステップ拡散モデル(後処理)

D. シーン理解

ベンチマークと基盤

システム 著者/年 キーコンセプト
EFM3D Straub (Meta) 2024 一人称視点の基盤モデルのための3Dベンチマーク、一人称視点動画からの深度・表面・セマンティック推定

3Dシーングラフ

システム 著者/年 キーコンセプト
Kimera / 3D Dynamic Scene Graph Rosinol 2020 Kimera-VIO、Kimera-Mesher、Kimera-PGMO、Kimera-Semantics、Kimera-DSG(ステレオ/モノキュラの視覚慣性パイプライン)
Hydra Hughes (MIT SPARK) 2022 リアルタイムな階層的シーングラフ(メッシュ→物体→場所→部屋→建物)
Hydra-Multi Chang 2023 分散マルチロボット3Dシーングラフ
Clio Maggio (MIT SPARK) 2024 オープンセットなタスク駆動型シーングラフ、ノードごとのCLIP埋め込み
Khronos Schmid (MIT SPARK) 2024 時空間シーングラフ、動的物体の履歴追跡
ConceptGraphs Gu 2023 オープンボキャブラリな3Dシーングラフ、SAM+CLIP+LLMによる関係推論

セマンティック/言語グラウンディングSLAM

システム 著者/年 キーコンセプト
ConceptFusion Jatavallabhula (MIT) 2023 CLIP特徴を3次元地図に融合、オープンボキャブラリな言語クエリ
LERF Kerr 2023 言語を埋め込んだRadiance Fields、DINOマルチスケール、NeRF+CLIP
OpenScene Peng (ETH) 2023 言語特徴を3次元点群に逆投影
SpatialLM Mao 2025 点群→LLM、Pythonスクリプトとして構造化された屋内モデリング

関連項目: LEGSOpenGS-SLAM (上記の柱E); Open-YOLO 3D (Level 5 物体検出)

E. 基盤モデル・ニューラル表現SLAM

基盤モデルSLAM

システム 著者/年 キーコンセプト
DUSt3R Wang 2024 画像ペアからのポイントマップ回帰、キャリブレーション不要
MASt3R Leroy 2024 DUSt3R+ローカル特徴マッチング
MASt3R-SLAM Murai 2024 MASt3Rの事前分布によるリアルタイム高密度SLAM
VGGT Wang (Meta) 2025 N視点からの姿勢・深度・ポイントマップ・トラックのフィードフォワード推論(CVPR 2025最優秀論文)
VGGT-SLAM Maggio 2025 SL(4)多様体上で最適化された高密度RGB SLAM、VGGTフロントエンド
VGGT-SLAM 2.0 Maggio 2026 リアルタイム高密度フィードフォワードシーン再構成
VGGT-Geo Qin 2026 高密度屋内SLAMのためのVGGT事前分布の確率的幾何融合
IGGT Li 2025 インスタンスに基づく幾何Transformer — 3次元再構成とインスタンスレベル理解の統合
AMB3R Wang 2025 バックエンドを備えた高精度フィードフォワードのメトリックスケール3次元再構成、SfM/SLAM対応
MASt3R-Fusion Zhou 2025 MASt3Rフィードフォワード視覚モデル+IMU+GNSS融合

NeRFベース

システム 著者/年 キーコンセプト
iMAP Sucar 2021 初のNeRF-SLAM、単一のMLP、リアルタイムトラッキング/マッピング
BARF Lin 2021 バンドル調整を行うNeRF、coarse-to-fineの位置エンコーディング、姿勢とNeRFの同時最適化(完全なSLAMではなく姿勢+NeRFの共同最適化)
NICE-SLAM Zhu & Peng 2022 階層的特徴グリッド(coarse/mid/fine)、スケーラブル
Co-SLAM Wang 2023 ハッシュグリッド(Instant-NGP)+座標エンコーディング、NICE-SLAMより5〜10倍高速
ESLAM Johari 2023 トライプレーン表現、O(N²)対O(N³)のメモリ使用量
Point-SLAM Sandström 2023 ニューラル点群ベース
NeRF-SLAM Rosinol 2023 NeRF+古典的SLAMパイプライン
NICER-SLAM Zhu 2024 RGBのみのNeRF-SLAM(深度センサー不要)、モノキュラ深度の統合
vMAP Kong 2023 物体レベルのNeRF-SLAM、物体ごとのニューラルフィールド
GO-SLAM Zhang 2023 グローバル最適化+NeRF-SLAM、ループクロージング+グローバルBA

3DGSベース

システム 著者/年 キーコンセプト
SplaTAM Keetha 2024 最初期の3DGS SLAMシステムの一つ(GS-SLAM、MonoGSと同時期)、RGB-D、シルエット誘導による高密度化
MonoGS Matsuki 2024 初のモノキュラ3DGS SLAM(CVPR 2024 highlight)、ラスタライズベースの直接トラッキング、解析的カメラヤコビアン
GS-ICP SLAM Ha 2024 Gaussian-to-Gaussian ICP(マハラノビス距離)、幾何ベースのトラッキング
Photo-SLAM Huang 2024 明示的な幾何+暗示的な見た目表現(MLPによる色)、アンチエイリアシング
RTG-SLAM Peng 2024 リアルタイム重視、適応的なガウシアン数の制御、Jetson Orinで25FPS
EGG-Fusion Pan 2025 幾何を考慮したガウシアンサーフェルのオンザフライ融合、情報フィルタベース、リアルタイム
Online 3DGS Modeling Lee 2025 新規視点選択を伴うオンライン3Dガウシアンスプラッティングモデリング
ActiveSplat Li 2025 3DGSによるアクティブマッピング+ボロノイ図ベースのパス計画
OpenGS-SLAM Yang 2025 オープンセットな高密度セマンティック3DGS SLAM、物体レベルのシーン理解
LEGS Yu 2024 言語を埋め込んだガウシアンスプラット、リアルタイムに言語で問い合わせ可能な3D表現