World Labs / Marble

Fei-Fei Li 2025 · 论文

一句话总结 — Marble 出自 Fei-Fei Li 创办的初创公司 World Labs,能够从图像、视频或文本提示生成持久、可导航的三维世界,并以高斯溅射(Gaussian-splat)场景的形式交付,将”空间智能(Spatial Intelligence)“定位为语言之后的下一个基础模型能力。

问题

通向三维场景的现有路径处于两个极端。重建方法(NeRF、三维高斯溅射)需要数十张对真实场所拍摄的带姿态输入图像,且只能重现已被观测过的内容。视频生成器(Sora、GAIA-1)能仅凭一条提示生成极具说服力的画面,但其输出是一段没有持久底层场景的二维像素流——移开视线再看回去,世界可能已经变了。World Labs 主张,世界模型应当能”重建、生成并模拟三维世界”,让人类和智能体与之交互,并据此构建了 Marble——一个输出为显式、持久三维世界的生成模型。

方法与架构

Marble 是一个商业系统;没有公开的论文、公式或训练细节。以下内容是根据 World Labs 公告(“Marble: A Multimodal World Model”,2025 年 11 月 12 日)描述的系统层面流程:

由于底层模型未公开,这里无法给出任何公式;请将本条目视为产品/系统层面的描述。

实验结果

没有公开的量化基准。公开展示的结果均为定性成果:从单张图像、文本、多图像和视频提示生成的可导航、视角一致的高斯溅射世界,涵盖多种场景类型和艺术风格;通过 Chisel 实现的结构可控生成;经过编辑、扩展和组合的世界;以及网格/视频导出(公告文章中几乎所有视频都是直接从 Marble 世界渲染而来)。相关演示请见 World Labs 博客;这些说法无法被独立验证。

对SLAM的意义

Marble 所瞄准的输出物件与 SLAM 所产生的相同——一个一致的、可渲染的三维场景——但它是通过基于先验的生成而非基于测量来获得这一结果的,这使得”传感器建图究竟何时才真正必要”这一问题变得更加尖锐。它的导出格式(高斯溅射、碰撞网格)恰恰正是现代 SLAM 与机器人仿真所消费的表示,这暗示了一些具体的混合应用方向:用合理的几何填补 SLAM 地图中未观测的区域、为探索提供地图先验,以及为测试 SLAM 和导航技术栈提供逼真的三维环境。作为出自 AI 领域最知名研究者之一的商业产品,它也标志着 Spatial AI 已经从研究愿景走向了产品竞赛。

相关条目