Open-YOLO 3D

Boudjoghra 2024 · 논문

한 줄 요약 — 느린 SAM + CLIP 라벨링 파이프라인을 실시간 개방형 어휘 2D 물체 검출기로 대체하는 빠른 개방형 어휘 3D 인스턴스 세그멘테이션으로, 기존 최고 성능 대비 약 16배의 속도 향상을 달성한다.

문제

개방형 어휘 3D 인스턴스 세그멘테이션은 강력한 가능성을 보여주었지만, 그 대가는 느린 추론이었다: OpenMask3D와 Open3DIS와 같은 방법들은 class-agnostic 3D 제안을 다수의 뷰에 투영하고, SAM으로 정제하고, CLIP으로 크롭을 인코딩하고, 3D CLIP 특징을 집계하여 라벨을 부여하는데 — 장면당 5~10분이 걸린다. 핵심 관찰은 다음과 같다: class-agnostic 3D 인스턴스를 이미지에 투영한 결과는 *이미 * 인스턴스 정보를 담고 있으므로, 최종 목표가 각 3D 마스크에 텍스트 라벨을 부여하는 것뿐이라면 뷰별 SAM 세그멘테이션은 중복이다. 두 번째 병목은 가시성 계산으로, 프레임마다 마스크마다 보이는 점을 반복적으로 세는 방식으로 수행되었다.

방법 및 아키텍처

파이프라인: 3D 네트워크가 마스크를 제안하고, 2D 검출기가 여러 뷰에 걸쳐 그 라벨에 투표한다.

Vf=1(0<Px2D<W)1(0<Py2D<H),Vd=1(Pz2DDz<τdepth)V^{f}=\mathbb{1}(0<P_{x}^{2D}<W)\odot\mathbb{1}(0<P_{y}^{2D}<H), \qquad V^{d}=\mathbb{1}(|P_{z}^{2D}-D_{z}|<\tau_{depth})

여기서 1\mathbb{1}은 지시 함수, DzD_z는 깊이 맵으로부터의 실제 깊이, τdepth\tau_{depth}는 임계값이다. 마스크별 분수 가시성은 모든 프레임에 대해 한 번의 연산으로 얻어진다:

V=((VfVd)MT)Mcount1V=\left((V^{f}\odot V^{d})\cdot M^{T}\right)\odot M_{count}^{-1}

여기서 McountM_{count}는 마스크별 점 개수이다.

실험 결과

ScanNet200 검증 세트(장면 312개, 200개 범주; Mask3D 제안; 단일 A100 40GB):

SLAM에서의 의미

개방형 어휘 시맨틱은 로봇이 맵에 대한 언어 질의에 답할 수 있게 하는(“소화기가 어디 있지?”) 요소이지만, 이는 대화형 속도로 동작해야만 온라인 로보틱스에 도움이 된다. Open-YOLO 3D는 실시간 2D 검출기와 다중 뷰 라벨 투표가 3D 인스턴스 라벨링에서 무거운 SAM+CLIP 파이프라인을 대체할 수 있음을 보였다 — 장면당 라벨링 시간을 몇 분에서 몇 초로 줄여, 개방형 어휘 시맨틱 매핑을 오프라인 후처리가 아니라 실시간 SLAM 시스템에 부착 가능한 실용적인 것으로 만들었다. 배치화된 투영/가시성 기법 또한 임의의 다중 뷰 시맨틱 융합 스택에 그대로 재사용될 수 있다.

관련 문서