レベル 11 / 11

ワールドモデルとSpatial AI

SLAM地図から学習されたワールド表現へ

キーコンセプト

ワールドモデル

システム 著者/年 キーコンセプト
GAIA-1 Wayve 2023 運転向けワールドモデル、行動条件付きの未来シーン生成
Sora / DiT OpenAI 2024 Diffusion Transformer、時空間パッチ、3次元理解の自然発生
NVIDIA Cosmos NVIDIA 2025 Physical AIのためのワールド基盤モデルプラットフォーム、自動運転車/ロボット向けの合成データ
World Labs / Marble Fei-Fei Li 2025 画像/動画/テキストプロンプトから生成される3次元世界(持続的なガウシアンスプラットシーン)
WorldVLA Cen (Alibaba) 2025 自己回帰的な行動ワールドモデル、行動生成のために物理法則を学習
SceneDINO Jevtić 2025 フィードフォワードな教師なしセマンティックシーン補完

生成3D

システム 著者/年 キーコンセプト
DreamFusion Poole 2023 Score Distillation Sampling(SDS)+NeRFによるText-to-3D

視覚言語モデル(VLM)

システム 著者/年 キーコンセプト
CLIP Radford (OpenAI) 2021 対照学習による画像・テキスト事前学習、4億ペア、ゼロショット
SigLIP Zhai (Google) 2023 シグモイド損失によるCLIP、より効率的、小型モデルでも高性能
BLIP-2 Li (Salesforce) 2023 Q-Formerが固定LLMと画像エンコーダを橋渡し
LLaVA Liu 2023 LLaMA+視覚、対話型VLM

視覚言語行動モデル(VLA)

システム 著者/年 キーコンセプト
RT-2 Brohan (DeepMind) 2023 ロボットの行動をテキストトークンとして表現、汎化能力の自然発生
OpenVLA Kim 2024 オープンソースVLA、SigLIP+Llama 7B+Action Head
NaVILA Cheng 2024 脚式/車輪式ロボットのナビゲーション向け視覚言語行動モデル

リソース

リソース 著者/年 キーコンセプト
Awesome-Transformer-based-SLAM KwanWaiPang Transformerベースの手法を厳選したGitHubリスト