Masked Depth Modeling (LingBot-Depth)

Tan 2026 · 논문

한 줄 요약 — RGB-D 센서가 유리, 거울, 광택 있는 금속에 남기는 구멍을 masked-autoencoder 스타일 사전학습을 위한 자연적인 마스크로 취급한다: ViT가 RGB와 깊이의 결합 임베딩을 학습하여 손상된 센서 입력으로부터 완전한 metric 깊이를 복원하며, 정밀도와 커버리지 모두에서 최상급 RGB-D 카메라를 능가한다.

문제

RGB-D 카메라는 metric scale, 픽셀 정렬된 dense geometry, 실시간 획득을 동시에 제공하는 유일한 modality지만, 그 stereo/구조광 매칭은 외관 모호성 아래서 실패한다: 텍스처가 적은 표면, 정반사, 투명한 재질, 복잡한 조명. 그 결과는 심각한 데이터 손상과 결측값이며, 하필 실내 로봇이 기하 정보를 가장 필요로 하는 곳에서 발생한다. 이 논문은 이러한 실패를 버려야 할 noise로 취급하는 대신 재구성한다: 결측 영역은 본질적으로 기하학적 모호성을 반영하는 “마스킹된” 신호이므로, 깊이 completion은 전체 RGB 이미지를 구조 문맥으로 삼는 masked-modeling 문제가 된다.

방법 및 아키텍처

**Masked Depth Modeling (MDM)**은 MAE의 encoder-decoder 패러다임을 따르지만 외관 대신 깊이를 예측한다:

실험 결과

SLAM에서의 의미

RGB-D SLAM 시스템(KinectFusion 스타일 fusion, RGB-D odometry)은 암묵적으로 센서를 신뢰하는데, 유리벽과 거울은 특히 실내에서 그런 표면이 어디에나 있기 때문에 가장 흔한 실세계 실패 사례 중 하나다. LingBot-Depth는 곧바로 끼워 넣을 수 있는 학습된 센서 프론트엔드로 동작한다 — 논문 자체의 카메라 tracking 실험은 raw 센서 깊이가 유리로 된 장면에서 심각한 drift를 유발하는 반면 completion된 깊이는 깨끗하게 추적됨을 보인다 — 이를 통해 SLAM 알고리즘 자체를 바꾸지 않고도 RGB-D SLAM이 동작할 수 있는 범위를 넓힌다. 자연적 마스크 사전학습이라는 아이디어는 또한 SLAM에 modality 간 정렬된 결합 RGB-깊이 표현을 제공한다.

관련 문서