Masked Depth Modeling (LingBot-Depth)
Tan 2026 · 論文
一行要約 — ガラス、鏡、光沢のある金属でRGB-Dセンサーが生じさせる欠損を自然なマスクとして扱い、マスク付きオートエンコーダ形式の事前学習を行う: ViTは破損したセンサー入力から完全なメトリック深度を再構成するRGB-深度の結合埋め込みを学習し、トップクラスのRGB-Dカメラを精度とカバレッジの両面で上回る。
問題
RGB-Dカメラは、メトリックスケール、画素対応した密な形状、リアルタイム取得を同時に提供する唯一のモダリティである——しかし、そのステレオ/構造化光マッチングは、見た目の曖昧さの下で失敗する: 低テクスチャの表面、鏡面反射、透明な材質、複雑な照明。その結果、屋内ロボットが幾何情報を最も必要とする場所でまさに深刻なデータの破損と欠損が生じる。これらの失敗を捨てるべき雑音として扱うのではなく、本論文はそれらを再解釈する: 欠損領域は本質的に幾何的な曖昧さを反映する「マスクされた」信号であり、したがって深度補完はRGB画像全体を救済コンテキストとするマスクモデリング問題になる。
手法とアーキテクチャ
Masked Depth Modeling (MDM) はMAEのエンコーダ・デコーダのパラダイムに従うが、見た目ではなく深度を予測する:
- 分離されたパッチ埋め込み。 RGB(3チャンネル)と深度(1チャンネル)は独立したパッチ埋め込み層を持ち、パッチサイズは14(DINOv2に従う)で、モダリティごとに空間的に整列したトークンのグリッドを生成する。各トークンは共有の学習可能な2次元空間位置埋め込みに加え、モダリティ埋め込み(RGBは1、深度は2)を受け取る。
- 自然なマスキング。 完全に欠損している深度パッチは常にマスクされる; 有効/無効が混在するパッチは確率0.75でマスクされる; ランダムに選ばれた完全に有効なパッチが追加され、全体として60~90%の深度マスク率になる。これらの自然なマスクは実際の曖昧さから生じる(ランダムなドロップアウトではない)ため、再構成は意図的に困難になっている——そしてマスクされていないRGB画像は常に条件として提供される。同じフレームワークが、マスク戦略だけで2つのタスクを統合する: すべての深度トークンをマスクする→純粋な単眼深度推定; 無効なトークンのみをマスクする→深度補完。
- エンコーダ/デコーダ。 すべてのRGBトークン+マスクされていない深度トークン+[cls]トークンが24ブロックのViT-Large(ViT-L/14、DINOv2で初期化)に入力される。潜在的な深度トークンは破棄され、[cls]トークンはコンテキストトークンにブロードキャスト加算され、それがConvStackデコーダ(MoGeから改変)を駆動する: 残差ブロックと転置畳み込み(カーネル2、ストライド2)のピラミッドがからまでアップサンプリングし、各スケールでUV位置エンコーディングが注入される。教師信号は有効な正解画素に対する単純なL1損失である。注意の可視化は、深度クエリが空間的に対応するRGB領域に注意を向けることを確認する。
- 学習。 25万イテレーション、128 GPUでグローバルバッチ1,024(約7.5日、BF16)、AdamW(, , 重み減衰0.05)、エンコーダ学習率/デコーダ学習率、ウォームアップとステップ減衰を伴う; 拡張にはカラージッター、JPEGアーティファクト、モーションブラー、ショットノイズを含む。
- データキュレーション。 合成Blenderパイプラインが、442の屋内シーンからRGB+完全な深度+スペックルパターンステレオペア(ベースラインは0.05
0.2 m、焦点距離1628 mmからサンプリング)をレンダリングし、SGMステレオマッチングを実行して現実的な失敗孔を持つセンサーらしい深度を生成する。3Dプリントされたモジュール式リグが市販カメラ(RealSense、Orbbec Gemini、ZED)を搭載し、FoundationStereo由来の擬似深度ラベル(左右チェック済み)を持つ200万件の実撮影を行う。7つの公開RGB-Dデータセットと合わせて、データセット全体は約1000万サンプルに達する; 300万のRGB-深度ペア(実データ200万+シミュレーションデータ100万)、コード、チェックポイントが公開されている。
実験結果
- 深度補完、プロトコル1(ブロック単位のマスキング+Kinect風のノイズ、4段階の難易度): iBims、NYUv2、DIODEにおいてすべてのレベルで最良のRMSE/REL——例えばNYUv2のextremeでRMSE 0.181(PromptDAの0.324に対して); iBimsのextremeで0.345(0.607に対して); 屋内ベンチマークではextreme設定でも最良の競合手法に対して40%を超えるRMSE削減。
- プロトコル2(疎なSfM点を入力とする、ETH3D): RMSE 0.192(屋内、最良のベースラインPriorDAの0.360より47%低い)、0.664(屋外、OMNI-DCの1.069より38%低い)、は屋内で0.982。
- 事前学習済みバックボーンとして: LingBot-Depthで初期化されたMoGeは、10個の単眼深度ベンチマーク全体でDINOv2初期化を上回る(例: NYUv2のアフィン不変REL 0.044対0.056)。FoundationStereoの単眼事前分布として使用すると、より速く収束する(エポック5のHAMMER EPE 0.27対バニラの0.46)し、全般的に最良または同等の結果で終わる(エポック15のMiddlebury EPE 0.75、HAMMER 0.17)。
- 応用、追加学習なし: OrbbecとZEDの両センサーが失敗する場所(ガラスのロビー、体育館の鏡、水槽トンネル)で、640×480・30FPSの時間的に一貫した映像深度補完を実現; ガラスの多いシーンで、洗練された深度を用いてSpatialTrackerV2のカメラ軌跡が滑らかになる; 20回中の器用な把持成功回数: スチールカップ17対13(生の深度)、透明カップ16対12、おもちゃの車16対9、透明な収納ボックス10対生の深度では完全に把持不可能。
SLAMにおける意義
RGB-D SLAMシステム(KinectFusion型の融合、RGB-Dオドメトリ)は暗黙的にセンサーを信頼している; ガラスの壁や鏡は、特にそのような表面がどこにでもある屋内では、最も一般的な実世界での失敗例の一つである。LingBot-Depthはそのまま差し替え可能な学習型センサーフロントエンドとして機能する——論文自体のカメラ追跡実験では、生のセンサー深度がガラスの多いシーンで深刻なドリフトを引き起こす一方、補完された深度はきれいに追跡できることが示されている——これにより、SLAMアルゴリズム自体を変更することなくRGB-D SLAMが動作可能な範囲を拡張する。その自然なマスクによる事前学習の考え方は、モダリティ間で整合したRGB-深度の結合表現もSLAMに提供する。
関連ノート
- Depth from sensor — 深度センサーの動作原理と失敗する箇所
- Depth Anything V2 — 単眼深度の基盤モデル、反射面にも強い
- Marigold — 精細な詳細を持つ生成的深度推定
- KinectFusion — 補正された深度を消費する古典的パイプライン