キーコンセプト
- 学習ベース対手作り(hand-crafted) — 個々の古典的モジュール(特徴、深度、マッチング)をネットワークで置き換える手法 対 end-to-endな学習
- 微分可能性 — 古典的な最適化(RANSAC、BA)を微分可能にし、学習を通せるようにすること
- 基盤モデル — 再利用可能な知覚バックボーンとしての大規模事前学習モデル(CLIP、SAM、DUSt3R系)
Level 5は5つの柱で構成される: A. フロントエンド — 手作りモジュールを置き換える学習ベースの知覚コンポーネント B. バックエンド — 古典的ソルバーを置き換える学習/certifiable(証明可能)な最適化 C. システム — end-to-endな深層VO/SLAMパイプライン D. シーン理解 — SLAM地図上でのセマンティック・言語・関係推論 E. 基盤モデル・ニューラルSLAM — ポイントマップTransformer、NeRFおよび3DGSベースの高密度SLAMシステム
A. 深層フロントエンド — 知覚
特徴点検出とマッチング
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| NetVLAD | Arandjelović 2016 | VLAD、場所認識 |
| SuperPoint | DeTone 2017 | Homographic Adaptation、自己教師あり、VGGエンコーダ+検出器/記述子ヘッド |
| HardNet | Mishchuk 2017 | 学習されたローカル記述子 |
| R2D2 | Revaud 2019 | 再現性と信頼性を備えた検出器/記述子、明示的な再現性/信頼性マップ |
| KeyNet | Barroso-Laguna 2019 | 学習された特徴点検出器 |
| HF-Net | Sarlin 2019 | グローバル特徴、ローカル特徴、視覚的位置推定 |
| SuperGlue | Sarlin 2020 | Self/Cross-attention GNN、Sinkhornによる最適割当、外れ値のためのdustbin |
| DISK | Tyszkiewicz 2020 | ポリシー勾配(強化学習)による学習、マッチの成否を報酬として利用 |
| Patch NetVLAD | Hausler 2021 | マルチスケールなパッチレベルVLAD |
| LoFTR | Sun 2021 | 検出器不要、Transformerによるcoarse-to-fineの高密度マッチング |
| LightGlue | Lindenberger 2023 | 適応的な深さ/幅、SuperGlueより5〜10倍高速 |
| XFeat | Potje 2024 | 0.3Mパラメータ、1400FPS(RTX 4090)、64次元記述子、組込み向け |
| RoMa | Edstedt 2024 | DINOv2基盤特徴+coarse-to-fineの高密度マッチング |
| DeDoDe | Edstedt 2024 | 検出と記述を単一段で同時に行う |
| RoMa v2 | Edstedt 2025 | より難しく・より良く・より速く・より密な高密度特徴マッチング |
深度推定
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| MonoDepth | Godard 2016 | 左右画像間の輝度一貫性、自己教師あり |
| MiDaS | Ranftl 2020 | 複数データセットの混合学習、スケール・シフト不変な損失、相対深度 |
| DPT | Ranftl 2021 | Dense Prediction Transformer(ViTバックボーン)、グローバルコンテキスト |
| ZoeDepth | Bhat 2023 | ゼロショットのメトリック深度、Metric Bins Module |
| Metric3D | Yin 2023 | カメラ内部パラメータを条件としたメトリック深度、Canonical Camera Space |
| Depth Anything | Yang 2024 | 6200万枚の画像、モノキュラ深度のための基盤モデル |
| Depth Anything V2 | Yang 2024 | 合成データによる改善、エッジ保存性の向上 |
| Depth Anything 3 | Lin 2025 | 任意の入力からの任意ビュー幾何、深度・レイ予測ターゲット、単一のプレーンなTransformer(DINOv2)、教師-生徒学習 |
| Marigold | Ke 2024 | 深度推定のためのStable Diffusion、細部の再現、サンプリングによる不確実性推定 |
| Align3R | Lu 2025 | 動画の時間的一貫性、DUSt3Rベース、CVPR 2025 Highlight |
| Masked Depth Modeling (LingBot-Depth) | Tan 2026 | ガラス・鏡・金属でのRGB-D失敗を修正 |
オプティカルフローとシーンフロー
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| FlowNet | Dosovitskiy 2015 | 初のend-to-endな深層オプティカルフロー(SimpleNet / CorrNet) |
| FlowNet 2.0 | Ilg 2017 | スタック型ネットワーク、古典手法並みの精度 |
| PWC-Net | Sun 2018 | Pyramid-Warping-Costボリューム、coarse-to-fine、840万パラメータ |
| FlowNet3D | Liu 2019 | 点群シーンフロー、PointNet++ベース |
| RAFT | Teed 2020 | All-Pairs Correlation+反復的ConvGRU更新、ECCV最優秀論文 |
| RAFT-3D | Teed 2021 | RAFTによるシーンフロー(3次元運動) |
| FlowFormer | Huang 2022 | コストボリュームトークン上のTransformer、グローバルコンテキスト |
| SEA-RAFT | Wang 2024 | リアルタイム向けの効率的なRAFT派生 |
カメラ姿勢回帰とリローカリゼーション
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| PoseNet | Kendall 2015 | CNNベースの6自由度姿勢回帰(APR)、GoogLeNetバックボーン |
| DSAC | Brachmann 2017 | 微分可能なRANSAC、シーン座標回帰(SCR) |
| DSAC++ | Brachmann 2018 | 自己教師あり、RGB-D対応 |
| CNN Pose Regression Limitations | Sattler 2019 | 姿勢回帰の性能は画像検索の性能とほぼ同等 |
| LM-Reloc | von Stumberg 2020 | 深層学習による直接リローカリゼーション |
| DSAC* | Brachmann 2021 | RGB/RGB-Dからの視覚的リローカリゼーション、学習の安定性を改善(TPAMI) |
| ACE | Brachmann 2023 | Accelerated Coordinate Encoding、シーンあたり5分の学習 |
| ACE Zero | Brachmann 2024 | ゼロショットSCR、事前構築済み3次元地図が不要 |
| ACE-G | Bruns 2025 | クエリの事前学習による汎化可能なSCR、ファインチューニングなしで新規シーンに対応 |
| ACE-SLAM | Alzugaray 2025 | ニューラル陰関数によるリアルタイムSLAM、ネットワークの重み=地図 |
| hloc | Sarlin 2019 | HF-Netの階層的位置推定(粗い(NetVLAD)→精密(SuperGlue))を実装したツールボックス |
SLAMのための物体検出とセグメンテーション
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| YOLO (v1→v11) | Redmon 2016→2024 | リアルタイム物体検出、Ultralyticsエコシステム |
| DETR | Carion 2020 | Transformerによる検出、アンカーフリー、NMS不要 |
| RT-DETR | Zhao (Baidu) 2023 | リアルタイムDETR、YOLOの速度+Transformerの精度 |
| RF-DETR | Robinson 2025 | DETRに対する重み共有NAS、精度-レイテンシのParetoチューニング、COCOで60 APを超えた初のリアルタイム検出器 |
| SAM | Kirillov 2023 | Segment Anything、プロンプトベース、基盤モデル |
| SAM 2 | Meta 2024 | 動画セグメンテーション、Memory Attention、時間的一貫性 |
| SAM 3 | Carion 2025 | プロンプト可能な概念セグメンテーション(名詞句/エグザンプラプロンプト)、プレゼンスヘッド、検出器+メモリベースの動画トラッカー |
| Grounding DINO | Liu 2023 | テキストプロンプトによる検出→SAMパイプライン(Grounded SAM) |
| Open-YOLO 3D | Boudjoghra 2024 | 2Dオープンボキャブラリ検出→3Dインスタンスセグメンテーション、16倍高速 |
B. 深層バックエンド — 最適化
微分可能バンドル調整
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| BA-Net | Tang 2019 | FPN+微分可能なLM層、end-to-endなSfM(ICLR) |
| DROID-SLAM | Teed 2021 | 高密度オプティカルフロー+微分可能な高密度BA、全画素の再投影 |
| DPVO | Teed 2023 | パッチベースのDROID-SLAM、30FPS以上のリアルタイム動作 |
| Theseus | Pineda (Meta) 2022 | 微分可能な非線形最適化ライブラリ(PyTorch) |
| Lietorch | Teed 2021 | PyTorch向けのリー群演算(SE(3)/SO(3)) |
C. End-to-Endな深層VO/SLAMシステム
自己教師あり・学習ベースVO
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| DeepVO | Wang 2017 | 教師あり学習 |
| SfM-Learner | Zhou 2017 | 教師なし、深層深度+深層姿勢 |
| DeMoN | Ummenhofer 2017 | 2フレームからの深度+運動、エンコーダ・デコーダ |
| UndeepVO | Li 2018 | ステレオによる自己教師あり、絶対スケールの復元 |
| DeepTAM | Zhou 2018 | 深層学習によるトラッキングとマッピング、コストボリュームベース |
| DeepV2D | Teed 2018 | 動画からの反復的深度推定、微分可能な幾何層 |
| Depth from Videos in the Wild | Gordon 2019 | 制約のない動画からの深度推定、学習されたカメラ内部パラメータ |
| Neural Ray Surfaces | Vasiljevic 2020 | 学習されたレイサーフェスモデル、非ピンホールカメラ |
| GradSLAM | Murthy 2020 | 微分可能なSLAMフレームワーク(PyTorch、複数のSLAMバックエンドに対応) |
| DeepSLAM | Li 2020 | TrackingNet、MappingNet、LoopNet |
| MonoRec | Wimbauer 2021 | 自己教師ありモノキュラ3次元再構成、移動物体対応 |
| TANDEM | Koestler 2021 | MVS深度によるリアルタイムトラッキング+高密度マッピング、DSOベース |
学習ベースSLAMシステム
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| DROID-SLAM | Teed 2021 | 微分可能なBA、高密度オプティカルフロー、end-to-endで学習 |
| TartanVO | Wang 2021 | 汎化性の高いビジュアルオドメトリ |
| DPV-SLAM | Lipson 2024 | DPVO+ループクロージング、完全なSLAM(ECCV 2024) |
| MAC-VO | Qiu 2024 | 学習ベースVO、メトリックスケールを考慮 |
| VoT | Yugay 2025 | Transformerを用いたビジュアルオドメトリ(後にFVOへ改題) |
潜在表現SLAM
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| CodeSLAM | Bloesch 2018 | 深度を128次元の潜在コードとして表現、コードと姿勢に対する輝度BA |
| SceneCode | Zhi 2019 | 深度とセマンティックを単一の潜在コードで表現、モダリティ間の制約 |
| DeepFactors | Czarnowski 2020 | 確率的な深度コード+ファクターグラフ、GPUで30FPS以上 |
| NodeSLAM | Sucar 2020 | 物体レベルのDeepSDFコード、物体ごとのoccupancy VAE |
| CodeMapping | Matsuki 2021 | 疎なSLAM+学習ベースの高密度マッピング、ハイブリッドアプローチ |
ニューラルレンダリング(参考)
NeRF/3DGSベースのSLAMシステム → 以下の柱Eを参照
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| NeRF | Mildenhall 2020 | Neural Radiance Fields、新規視点合成(基礎的研究) |
| DIFIX3D+ | Wu 2025 | 3次元再構成のアーティファクト除去のための単一ステップ拡散モデル(後処理) |
D. シーン理解
ベンチマークと基盤
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| EFM3D | Straub (Meta) 2024 | 一人称視点の基盤モデルのための3Dベンチマーク、一人称視点動画からの深度・表面・セマンティック推定 |
3Dシーングラフ
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| Kimera / 3D Dynamic Scene Graph | Rosinol 2020 | Kimera-VIO、Kimera-Mesher、Kimera-PGMO、Kimera-Semantics、Kimera-DSG(ステレオ/モノキュラの視覚慣性パイプライン) |
| Hydra | Hughes (MIT SPARK) 2022 | リアルタイムな階層的シーングラフ(メッシュ→物体→場所→部屋→建物) |
| Hydra-Multi | Chang 2023 | 分散マルチロボット3Dシーングラフ |
| Clio | Maggio (MIT SPARK) 2024 | オープンセットなタスク駆動型シーングラフ、ノードごとのCLIP埋め込み |
| Khronos | Schmid (MIT SPARK) 2024 | 時空間シーングラフ、動的物体の履歴追跡 |
| ConceptGraphs | Gu 2023 | オープンボキャブラリな3Dシーングラフ、SAM+CLIP+LLMによる関係推論 |
セマンティック/言語グラウンディングSLAM
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| ConceptFusion | Jatavallabhula (MIT) 2023 | CLIP特徴を3次元地図に融合、オープンボキャブラリな言語クエリ |
| LERF | Kerr 2023 | 言語を埋め込んだRadiance Fields、DINOマルチスケール、NeRF+CLIP |
| OpenScene | Peng (ETH) 2023 | 言語特徴を3次元点群に逆投影 |
| SpatialLM | Mao 2025 | 点群→LLM、Pythonスクリプトとして構造化された屋内モデリング |
関連項目: LEGS、OpenGS-SLAM (上記の柱E); Open-YOLO 3D (Level 5 物体検出)
E. 基盤モデル・ニューラル表現SLAM
基盤モデルSLAM
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| DUSt3R | Wang 2024 | 画像ペアからのポイントマップ回帰、キャリブレーション不要 |
| MASt3R | Leroy 2024 | DUSt3R+ローカル特徴マッチング |
| MASt3R-SLAM | Murai 2024 | MASt3Rの事前分布によるリアルタイム高密度SLAM |
| VGGT | Wang (Meta) 2025 | N視点からの姿勢・深度・ポイントマップ・トラックのフィードフォワード推論(CVPR 2025最優秀論文) |
| VGGT-SLAM | Maggio 2025 | SL(4)多様体上で最適化された高密度RGB SLAM、VGGTフロントエンド |
| VGGT-SLAM 2.0 | Maggio 2026 | リアルタイム高密度フィードフォワードシーン再構成 |
| VGGT-Geo | Qin 2026 | 高密度屋内SLAMのためのVGGT事前分布の確率的幾何融合 |
| IGGT | Li 2025 | インスタンスに基づく幾何Transformer — 3次元再構成とインスタンスレベル理解の統合 |
| AMB3R | Wang 2025 | バックエンドを備えた高精度フィードフォワードのメトリックスケール3次元再構成、SfM/SLAM対応 |
| MASt3R-Fusion | Zhou 2025 | MASt3Rフィードフォワード視覚モデル+IMU+GNSS融合 |
NeRFベース
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| iMAP | Sucar 2021 | 初のNeRF-SLAM、単一のMLP、リアルタイムトラッキング/マッピング |
| BARF | Lin 2021 | バンドル調整を行うNeRF、coarse-to-fineの位置エンコーディング、姿勢とNeRFの同時最適化(完全なSLAMではなく姿勢+NeRFの共同最適化) |
| NICE-SLAM | Zhu & Peng 2022 | 階層的特徴グリッド(coarse/mid/fine)、スケーラブル |
| Co-SLAM | Wang 2023 | ハッシュグリッド(Instant-NGP)+座標エンコーディング、NICE-SLAMより5〜10倍高速 |
| ESLAM | Johari 2023 | トライプレーン表現、O(N²)対O(N³)のメモリ使用量 |
| Point-SLAM | Sandström 2023 | ニューラル点群ベース |
| NeRF-SLAM | Rosinol 2023 | NeRF+古典的SLAMパイプライン |
| NICER-SLAM | Zhu 2024 | RGBのみのNeRF-SLAM(深度センサー不要)、モノキュラ深度の統合 |
| vMAP | Kong 2023 | 物体レベルのNeRF-SLAM、物体ごとのニューラルフィールド |
| GO-SLAM | Zhang 2023 | グローバル最適化+NeRF-SLAM、ループクロージング+グローバルBA |
3DGSベース
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| SplaTAM | Keetha 2024 | 最初期の3DGS SLAMシステムの一つ(GS-SLAM、MonoGSと同時期)、RGB-D、シルエット誘導による高密度化 |
| MonoGS | Matsuki 2024 | 初のモノキュラ3DGS SLAM(CVPR 2024 highlight)、ラスタライズベースの直接トラッキング、解析的カメラヤコビアン |
| GS-ICP SLAM | Ha 2024 | Gaussian-to-Gaussian ICP(マハラノビス距離)、幾何ベースのトラッキング |
| Photo-SLAM | Huang 2024 | 明示的な幾何+暗示的な見た目表現(MLPによる色)、アンチエイリアシング |
| RTG-SLAM | Peng 2024 | リアルタイム重視、適応的なガウシアン数の制御、Jetson Orinで25FPS |
| EGG-Fusion | Pan 2025 | 幾何を考慮したガウシアンサーフェルのオンザフライ融合、情報フィルタベース、リアルタイム |
| Online 3DGS Modeling | Lee 2025 | 新規視点選択を伴うオンライン3Dガウシアンスプラッティングモデリング |
| ActiveSplat | Li 2025 | 3DGSによるアクティブマッピング+ボロノイ図ベースのパス計画 |
| OpenGS-SLAM | Yang 2025 | オープンセットな高密度セマンティック3DGS SLAM、物体レベルのシーン理解 |
| LEGS | Yu 2024 | 言語を埋め込んだガウシアンスプラット、リアルタイムに言語で問い合わせ可能な3D表現 |