EFM3D

Straub (Meta) 2024 · 论文

一句话总结 — Meta Reality Labs推出的基准,用于衡量迈向3D第一视角基础模型(3D Egocentric Foundation Models)的进展——在带标注的Project Aria第一视角视频上进行3D物体检测和表面回归——并提出EVL基线,将冻结的2D基础模型特征提升到一个与重力方向对齐的3D体素网格中。

问题

可穿戴计算设备为AI创造了一种新的情境来源:第一视角传感器数据自带精细的3D位置信息(位姿、标定、半稠密SLAM点)。这为一类根植于3D空间的空间基础模型打开了机会——作者称之为第一视角基础模型(Egocentric Foundation Models,EFM)——但若没有基于高质量、带3D标注的第一视角数据构建的基准,就无法衡量进展。现有的3D数据集大多是RGB-D扫描序列(ScanNet、ARKitScenes)或以”覆盖”所有表面为运动目标的仿真数据;而Aria数据则不同,它只有一路RGB流和两路灰度流,只有稀疏的半稠密深度,以及真实的头部运动模式——这些差异会破坏那些专为RGB-D扫描场景设计的模型。

方法与架构

数据集贡献。 (i) 针对仿真的Aria Synthetic Environments(ASE)数据集,提供约300万个跨43个类别的3D有向边界框(OBB),并附带逐图像的可见性元数据;(ii) Aria Everyday Objects(AEO),一个真实世界验证集,包含26个场景、584个OBB实例,覆盖9个类别,由非专业人员拍摄以获得真实的第一视角运动;(iii) 为ASE验证集划分以及真实的Aria Digital Twin(ADT)数据集提供真值网格。

**EVL(Egocentric Voxel Lifting,第一视角体素提升)**是一个通用的3D骨干网络:一个冻结的2D基础模型(DINOv2.5)在每段视频每路流的TT个已知位姿帧上运行;特征被上采样,然后将一个以最新的重力对齐RGB位姿为锚点的局部重力对齐4m34m^3体素网格的中心,用经过标定的鱼眼模型投影到每张图像中并双线性采样,得到每路流一个T×F×D×H×WT\times F\times D\times H\times W的体积。特征在流和时间维度上通过均值和标准差聚合(2F×D×H×W2F\times D\times H\times W)。半稠密SLAM点贡献两个二值掩码——一个表面点掩码和一个沿观测射线采样得到的自由空间掩码——被拼接到该体积上,随后由一个3D U-Net(8倍下采样/上采样)处理。任务头在输出体积上运行:

Lobj=1NvnNvwcFL(vnc,vnc^)+wiouIoU(vnobb,vnobb^)+wclsFL(vncls,vncls^)L_{obj}=\frac{1}{N_{v}}\sum^{N_{v}}_{n} w_{c}\,\mathrm{FL}(v_{n}^{c},\widehat{v_{n}^{c}})+w_{iou}\,\mathrm{IoU}(v_{n}^{obb},\widehat{v_{n}^{obb}})+w_{cls}\,\mathrm{FL}(v_{n}^{cls},\widehat{v_{n}^{cls}})

Lsurf=1NnNFL(pfreen,0.0)+FL(psurfn,0.5)+FL(poccn,1.0)L_{surf}=\frac{1}{N}\sum^{N}_{n}\mathrm{FL}(p_{\text{free}}^{n},0.0)+\mathrm{FL}(p_{\text{surf}}^{n},0.5)+\mathrm{FL}(p_{\text{occ}}^{n},1.0)

训练使用1秒、10Hz的片段,检测任务使用6.25厘米体素(64364^3),表面任务使用4厘米体素(96396^3),采用Adam优化器,学习率2e42e^{-4},权重设置为wcent=100w_{cent}=100wiou=10w_{iou}=10wclass=1w_{class}=1;在序列级评估中,通过OBB跟踪/融合以及占据的滑动平均融合加marching cubes来持续保留预测结果。

实验结果

对SLAM的意义

AR眼镜是SLAM的主要商业驱动力之一,而EFM3D定义了在这一场景下”良好的3D感知”意味着什么:在由人类头部运动主导的可穿戴设备上,实现度量精确、3D一致的场景理解。它揭示了该领域的发展方向——由SLAM提供的位姿、标定和半稠密点成为支撑3D提升的基础设施(EVL的掩码本质上就是SLAM的输出),而大型第一视角感知模型又反过来将语义先验反馈给空间跟踪系统。

相关条目