Masked Depth Modeling (LingBot-Depth)

Tan 2026 · 論文

一行要約 — ガラス、鏡、光沢のある金属でRGB-Dセンサーが生じさせる欠損を自然なマスクとして扱い、マスク付きオートエンコーダ形式の事前学習を行う: ViTは破損したセンサー入力から完全なメトリック深度を再構成するRGB-深度の結合埋め込みを学習し、トップクラスのRGB-Dカメラを精度とカバレッジの両面で上回る。

問題

RGB-Dカメラは、メトリックスケール、画素対応した密な形状、リアルタイム取得を同時に提供する唯一のモダリティである——しかし、そのステレオ/構造化光マッチングは、見た目の曖昧さの下で失敗する: 低テクスチャの表面、鏡面反射、透明な材質、複雑な照明。その結果、屋内ロボットが幾何情報を最も必要とする場所でまさに深刻なデータの破損と欠損が生じる。これらの失敗を捨てるべき雑音として扱うのではなく、本論文はそれらを再解釈する: 欠損領域は本質的に幾何的な曖昧さを反映する「マスクされた」信号であり、したがって深度補完はRGB画像全体を救済コンテキストとするマスクモデリング問題になる。

手法とアーキテクチャ

Masked Depth Modeling (MDM) はMAEのエンコーダ・デコーダのパラダイムに従うが、見た目ではなく深度を予測する:

実験結果

SLAMにおける意義

RGB-D SLAMシステム(KinectFusion型の融合、RGB-Dオドメトリ)は暗黙的にセンサーを信頼している; ガラスの壁や鏡は、特にそのような表面がどこにでもある屋内では、最も一般的な実世界での失敗例の一つである。LingBot-Depthはそのまま差し替え可能な学習型センサーフロントエンドとして機能する——論文自体のカメラ追跡実験では、生のセンサー深度がガラスの多いシーンで深刻なドリフトを引き起こす一方、補完された深度はきれいに追跡できることが示されている——これにより、SLAMアルゴリズム自体を変更することなくRGB-D SLAMが動作可能な範囲を拡張する。その自然なマスクによる事前学習の考え方は、モダリティ間で整合したRGB-深度の結合表現もSLAMに提供する。

関連ノート