EFM3D

Straub (Meta) 2024 · 論文

一行要約 — 3Dエゴセントリック基盤モデル(3D Egocentric Foundation Models)への進歩を測定するためのMeta Reality Labsのベンチマーク——注釈付きProject Aria自己視点動画に対する3D物体検出と表面回帰——に加え、凍結した2D基盤モデルの特徴を重力方向に整列した3DボクセルグリッドへリフトするベースラインEVLを提供する。

問題

ウェアラブルコンピュータはAIにとって新たな文脈の源を生み出す:細粒度の3D位置情報(姿勢、キャリブレーション、半密なSLAM点)を備えたエゴセントリックなセンサーデータである。これは、著者らが Egocentric Foundation Models(EFM)と呼ぶ、3D空間に根ざした空間的基盤モデルの新しいクラスの可能性を開くが、高品質で3Dアノテーション付きのエゴセントリックデータで構築されたベンチマークがなければ進歩を測ることはできない。既存の3DデータセットはRGB-Dスキャンシーケンス(ScanNet、ARKitScenes)であるか、すべての表面を「網羅」することを目指した動きのシミュレーションである;Ariaデータは代わりに1本のRGB+2本のグレースケールストリームを持ち、疎な半密深度のみで、本物の頭部運動パターンを持つ——これらの違いは、RGB-Dスキャンの体系向けに設計されたモデルを破綻させる。

手法とアーキテクチャ

データセットへの貢献。(i)シミュレートされたAria Synthetic Environments(ASE)データセットに対する、43クラスにわたる約300万個の3D有向境界ボックス(OBB)と画像ごとの可視性メタデータ;(ii)Aria Everyday Objects(AEO)——9クラスにわたる584個のOBBインスタンスを持つ26シーンの実世界検証セットで、現実的なエゴセントリックな動きを捉えるため非専門家によって撮影された;(iii)ASE検証分割および実世界のAria Digital Twin(ADT)データセットに対する正解メッシュ。

**EVL(Egocentric Voxel Lifting)**は汎用的な3Dバックボーンである:凍結された2D基盤モデル(DINOv2.5)が各ビデオストリームのTT個の姿勢付きフレームに対して実行される;特徴はアップサンプリングされ、その後、局所的で重力方向に整列した4m34m^3のボクセルグリッド(最新の重力方向に整列したRGB姿勢に固定)の中心が、キャリブレーションされた魚眼モデルを用いてすべての画像に投影され、双線形サンプリングされる。これにより各ストリームにつきT×F×D×H×WT\times F\times D\times H\times Wのボリュームが得られる。特徴はストリームと時間にわたって平均と標準偏差(2F×D×H×W2F\times D\times H\times W)で集約される。半密なSLAM点は2つのバイナリマスク——表面点マスクと、観測レイに沿ってサンプリングされた自由空間マスク——を提供し、これがボリュームに連結され、その後3D U-Net(8倍のダウンサンプル/アップサンプル)によって処理される。タスクヘッドは出力ボリューム上で実行される:

Lobj=1NvnNvwcFL(vnc,vnc^)+wiouIoU(vnobb,vnobb^)+wclsFL(vncls,vncls^)L_{obj}=\frac{1}{N_{v}}\sum^{N_{v}}_{n} w_{c}\,\mathrm{FL}(v_{n}^{c},\widehat{v_{n}^{c}})+w_{iou}\,\mathrm{IoU}(v_{n}^{obb},\widehat{v_{n}^{obb}})+w_{cls}\,\mathrm{FL}(v_{n}^{cls},\widehat{v_{n}^{cls}})

Lsurf=1NnNFL(pfreen,0.0)+FL(psurfn,0.5)+FL(poccn,1.0)L_{surf}=\frac{1}{N}\sum^{N}_{n}\mathrm{FL}(p_{\text{free}}^{n},0.0)+\mathrm{FL}(p_{\text{surf}}^{n},0.5)+\mathrm{FL}(p_{\text{occ}}^{n},1.0)

学習には1秒10Hzのスニペット、検出用に6.25cmボクセル(64364^3)、表面用に4cmボクセル(96396^3)を使用し、wcent=100w_{cent}=100wiou=10w_{iou}=10wclass=1w_{class}=1で学習率2e42e^{-4}のAdamを用いる;シーケンスレベルの評価は、OBBの追跡/融合と移動平均の占有融合およびmarching cubesによって予測を持続させる。

実験結果

SLAMにおける意義

ARグラスはSLAMの主要な商業的推進力の一つであり、EFM3Dはその文脈での「良い3D知覚」が何を意味するかを定義する:人間の頭部の動きに支配されるウェアラブルリグから得られる、計量的に正確で3D整合性のある理解である。これは分野の進む方向を示している——SLAMが提供する姿勢、キャリブレーション、半密な点が3Dリフティングを可能にする足場となり(EVLのマスクは文字通りSLAMの出力である)、大規模なエゴセントリック知覚モデルは今度はセマンティックな事前分布を空間トラッキングシステムへ返す。

関連ノート