World Labs / Marble
Fei-Fei Li 2025 · 论文
一句话总结 — Marble 出自 Fei-Fei Li 创办的初创公司 World Labs,能够从图像、视频或文本提示生成持久、可导航的三维世界,并以高斯溅射(Gaussian-splat)场景的形式交付,将”空间智能(Spatial Intelligence)“定位为语言之后的下一个基础模型能力。
问题
通向三维场景的现有路径处于两个极端。重建方法(NeRF、三维高斯溅射)需要数十张对真实场所拍摄的带姿态输入图像,且只能重现已被观测过的内容。视频生成器(Sora、GAIA-1)能仅凭一条提示生成极具说服力的画面,但其输出是一段没有持久底层场景的二维像素流——移开视线再看回去,世界可能已经变了。World Labs 主张,世界模型应当能”重建、生成并模拟三维世界”,让人类和智能体与之交互,并据此构建了 Marble——一个输出为显式、持久三维世界的生成模型。
方法与架构
Marble 是一个商业系统;没有公开的论文、公式或训练细节。以下内容是根据 World Labs 公告(“Marble: A Multimodal World Model”,2025 年 11 月 12 日)描述的系统层面流程:
- 多模态提示到三维:Marble 能把文本、单张图像、多张图像、视频,或一个粗略的三维布局,提升为一个完整的三维世界。多图像提示会将不同视角分配给世界的不同部分(例如前面/后面),Marble 会将它们拼接成一个一致的场景——包括由真实场所的照片或短视频构建出的世界。
- Chisel —— 结构/风格解耦:一种实验性模式,用户在其中布置粗略的三维几何(长方体、平面、导入的素材)来固定世界的结构,同时用文本提示控制其风格;两者可以任意组合混用。
- AI 原生的世界编辑:局部编辑(移除/替换物体)、风格变化,或对已生成世界的大幅重构;可区域选择的**扩展(expansion)**功能会在溅射点退化的地方扩大世界并补充细节;**合成模式(composer mode)**在用户明确控制的布局下,将多个生成的世界组装成大型空间。
- 导出格式:作为最高保真度表示的高斯溅射(可通过 Spark——World Labs 开源的 THREE.js 渲染器——在浏览器中渲染);两种风格的三角网格——用于物理仿真的低保真*碰撞网格(collider mesh)*和高质量视觉网格;以及具有像素精确相机控制的视频渲染,可选择性地”增强”添加动态效果(烟雾、火焰、流水),同时保持相机路径和三维结构不变。
- 背景:此前有 2024 年 12 月的”Generating Worlds”预览版和 2025 年 10 月的实时帧模型 RTFM;此后是 2026 年 1 月公开的 World API。Fei-Fei Li 随附的宣言将空间智能——感知、推理并在三维空间中行动——定位为 AI 的下一个前沿。
由于底层模型未公开,这里无法给出任何公式;请将本条目视为产品/系统层面的描述。
实验结果
没有公开的量化基准。公开展示的结果均为定性成果:从单张图像、文本、多图像和视频提示生成的可导航、视角一致的高斯溅射世界,涵盖多种场景类型和艺术风格;通过 Chisel 实现的结构可控生成;经过编辑、扩展和组合的世界;以及网格/视频导出(公告文章中几乎所有视频都是直接从 Marble 世界渲染而来)。相关演示请见 World Labs 博客;这些说法无法被独立验证。
对SLAM的意义
Marble 所瞄准的输出物件与 SLAM 所产生的相同——一个一致的、可渲染的三维场景——但它是通过基于先验的生成而非基于测量来获得这一结果的,这使得”传感器建图究竟何时才真正必要”这一问题变得更加尖锐。它的导出格式(高斯溅射、碰撞网格)恰恰正是现代 SLAM 与机器人仿真所消费的表示,这暗示了一些具体的混合应用方向:用合理的几何填补 SLAM 地图中未观测的区域、为探索提供地图先验,以及为测试 SLAM 和导航技术栈提供逼真的三维环境。作为出自 AI 领域最知名研究者之一的商业产品,它也标志着 Spatial AI 已经从研究愿景走向了产品竞赛。