IGGT

Li 2025 · 论文

一句话总结 —— 一种实例感知的几何Transformer(instance-grounded geometry transformer),将前馈式3D重建与实例级场景理解统一到单一模型中,而不是在单独重建出的地图上再嫁接语义信息。

问题

人类感知几何结构与语义内容是相互交织的,但大多数流水线将两者分开处理:大型几何模型(DUSt3R/VGGT系列)被训练用于低层次的3D重建,而高层次的空间理解则被单独处理——这”限制了泛化能力,并导致下游3D理解任务性能不佳”。近期的一些改进方法将3D模型与某个特定的视觉-语言模型对齐,但这会过度平滑精细的几何细节,将感知能力限制在被对齐模型的能力上限(例如LSeg),并且——由于VLM特征是类别级别的——无法区分同一类别下的不同物体,在大视角变化下会破坏实例跟踪。

方法与架构

IGGT在一次前向传播中将 NN 幅图像映射为几何信息实例特征:

F:{Ii}i=1N(ti,Di,Pi,Si)i=1N,\mathcal{F}: \{I_i\}_{i=1}^{N} \mapsto (t_i, D_i, P_i, S_i)_{i=1}^{N},

其中 tit_i 是相机参数,DiD_i 是深度图,PiP_i 是点图,SiS_i 是3D一致的实例级特征图。

实验结果

在ScanNet和ScanNet++上评测(各10个场景,每场景8-10张图像):

对SLAM的意义

DUSt3R/VGGT系列的发展趋势是让基础模型为SLAM系统免费提供稠密几何信息;IGGT把这一趋势扩展到场景中”有什么”,而不仅仅是”表面在哪里”。对于Spatial AI而言——操作、语义导航、AR——一张被分割为3D一致的物体实例的地图,远比原始几何信息更具可操作性,并且在一个前馈模型内部完成这件事,可以避免将逐帧2D分割(SAM掩码、CLIP特征)拼接到3D地图上所带来的不一致性。将掩码作为桥梁的设计还意味着,随着更好的VLM出现,语义部分可以免费升级。

相关条目