キーコンセプト
- ワールドモデル — 環境の力学を学習した生成モデルであり、予測や計画に利用できる
- VLM対VLA — 視覚言語モデル(VLM)は画像について推論する;視覚言語行動モデル(VLA)はさらにロボットの行動を出力する
- Spatial AI — SLAM、シーン理解、学習されたワールド表現の融合(Davisonの提唱するFutureMappingのビジョン)
ワールドモデル
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| GAIA-1 | Wayve 2023 | 運転向けワールドモデル、行動条件付きの未来シーン生成 |
| Sora / DiT | OpenAI 2024 | Diffusion Transformer、時空間パッチ、3次元理解の自然発生 |
| NVIDIA Cosmos | NVIDIA 2025 | Physical AIのためのワールド基盤モデルプラットフォーム、自動運転車/ロボット向けの合成データ |
| World Labs / Marble | Fei-Fei Li 2025 | 画像/動画/テキストプロンプトから生成される3次元世界(持続的なガウシアンスプラットシーン) |
| WorldVLA | Cen (Alibaba) 2025 | 自己回帰的な行動ワールドモデル、行動生成のために物理法則を学習 |
| SceneDINO | Jevtić 2025 | フィードフォワードな教師なしセマンティックシーン補完 |
生成3D
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| DreamFusion | Poole 2023 | Score Distillation Sampling(SDS)+NeRFによるText-to-3D |
視覚言語モデル(VLM)
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| CLIP | Radford (OpenAI) 2021 | 対照学習による画像・テキスト事前学習、4億ペア、ゼロショット |
| SigLIP | Zhai (Google) 2023 | シグモイド損失によるCLIP、より効率的、小型モデルでも高性能 |
| BLIP-2 | Li (Salesforce) 2023 | Q-Formerが固定LLMと画像エンコーダを橋渡し |
| LLaVA | Liu 2023 | LLaMA+視覚、対話型VLM |
視覚言語行動モデル(VLA)
| システム | 著者/年 | キーコンセプト |
|---|---|---|
| RT-2 | Brohan (DeepMind) 2023 | ロボットの行動をテキストトークンとして表現、汎化能力の自然発生 |
| OpenVLA | Kim 2024 | オープンソースVLA、SigLIP+Llama 7B+Action Head |
| NaVILA | Cheng 2024 | 脚式/車輪式ロボットのナビゲーション向け視覚言語行動モデル |
リソース
| リソース | 著者/年 | キーコンセプト |
|---|---|---|
| Awesome-Transformer-based-SLAM | KwanWaiPang | Transformerベースの手法を厳選したGitHubリスト |