Open-YOLO 3D
Boudjoghra 2024 · 논문
한 줄 요약 — 느린 SAM + CLIP 라벨링 파이프라인을 실시간 개방형 어휘 2D 물체 검출기로 대체하는 빠른 개방형 어휘 3D 인스턴스 세그멘테이션으로, 기존 최고 성능 대비 약 16배의 속도 향상을 달성한다.
문제
개방형 어휘 3D 인스턴스 세그멘테이션은 강력한 가능성을 보여주었지만, 그 대가는 느린 추론이었다: OpenMask3D와 Open3DIS와 같은 방법들은 class-agnostic 3D 제안을 다수의 뷰에 투영하고, SAM으로 정제하고, CLIP으로 크롭을 인코딩하고, 3D CLIP 특징을 집계하여 라벨을 부여하는데 — 장면당 5~10분이 걸린다. 핵심 관찰은 다음과 같다: class-agnostic 3D 인스턴스를 이미지에 투영한 결과는 *이미 * 인스턴스 정보를 담고 있으므로, 최종 목표가 각 3D 마스크에 텍스트 라벨을 부여하는 것뿐이라면 뷰별 SAM 세그멘테이션은 중복이다. 두 번째 병목은 가시성 계산으로, 프레임마다 마스크마다 보이는 점을 반복적으로 세는 방식으로 수행되었다.
방법 및 아키텍처
파이프라인: 3D 네트워크가 마스크를 제안하고, 2D 검출기가 여러 뷰에 걸쳐 그 라벨에 투표한다.
- Class-agnostic 3D 제안: Mask3D(3D CNN backbone + transformer mask decoder)가 개의 포인트 클라우드에 대해 개의 이진 인스턴스 마스크 를 예측한다(NMS로 필터링되며, 추론 속도를 위해 DBSCAN은 사용하지 않는다).
- Low-Granularity(LG) 라벨 맵: 개방형 어휘 2D 검출기(YOLO-World XL)가 RGB 프레임마다 박스 를 생성한다. 각 프레임은 라벨 맵 가 되며 -1(클래스 없음)로 초기화된다; 박스 영역은 가중치 의 내림차순으로 클래스 라벨이 채워지므로, (더 가깝고 잘 보이는) 더 작은 박스가 더 큰 박스를 덮어쓴다.
- 가속화된 가시성 계산(VAcc): 모든 점을 모든 개의 프레임에 하나의 배치 연산으로 투영한다, (는 내부/외부 파라미터, 는 배치 행렬 곱). 프레임 내 여부와 가림 여부는 텐서 연산으로 계산된다:
여기서 은 지시 함수, 는 깊이 맵으로부터의 실제 깊이, 는 임계값이다. 마스크별 분수 가시성은 모든 프레임에 대해 한 번의 연산으로 얻어진다:
여기서 는 마스크별 점 개수이다.
- Multi-View Prompt Distribution(MVPDist): 각 3D 마스크에 대해 가시성이 가장 높은 상위 k개 프레임을 취해, 투영되고 가려지지 않은 점 좌표에서 LG 라벨 맵 값을 조회하고, 이를 풀링하여 라벨 분포 를 구성한다; 마스크는 가장 빈도가 높은 클래스를 부여받는다 — CLIP 특징 집계 없이, 가림과 시점 모호성을 다중 뷰 합의로 해결하는 방식이다.
- 신뢰도 점수: 로, MVPDist 클래스 확률과 투영된 3D 마스크의 바운딩 박스와 가장 잘 매칭되는 2D 검출 사이의 평균 다중 뷰 IoU를 결합한다.
실험 결과
ScanNet200 검증 세트(장면 312개, 200개 범주; Mask3D 제안; 단일 A100 40GB):
- Open-YOLO 3D: 24.7 mAP, 31.7 mAP50, 36.2 mAP25, 장면당 21.8초 — 2D+3D 제안을 사용하는 Open3DIS의 23.7 mAP, 360.12초(약 16배 빠르며, +1.0 mAP, +2.3 mAP50), 3D만 사용하는 Open3DIS의 18.6 mAP(57.68초), OpenMask3D의 15.4 mAP(553.87초)와 비교된다. Tail 클래스: 21.6 mAP로 OpenMask3D의 14.9를 능가한다. 폐쇄형 어휘 Mask3D 상한: 26.9 mAP.
- Replica(48개 범주, ScanNet200으로 학습된 Mask3D의 제안 사용 — 일반화 테스트): Open3DIS의 18.5 mAP(187.97초), OpenMask3D의 13.1 mAP(547.32초)에 비해 장면당 16.6초에 23.7 mAP.
- Ground-truth 제안을 사용한 ablation은 두 교체 모두가 도움이 됨을 확인한다: SAM 기반 high-granularity 맵을 LG 라벨 맵으로 바꾸고 CLIP 특징을 MVPDist로 바꾸면 각각 mAP를 유지하거나 개선하면서 시간을 줄인다; 코드와 모델이 공개되어 있다.
SLAM에서의 의미
개방형 어휘 시맨틱은 로봇이 맵에 대한 언어 질의에 답할 수 있게 하는(“소화기가 어디 있지?”) 요소이지만, 이는 대화형 속도로 동작해야만 온라인 로보틱스에 도움이 된다. Open-YOLO 3D는 실시간 2D 검출기와 다중 뷰 라벨 투표가 3D 인스턴스 라벨링에서 무거운 SAM+CLIP 파이프라인을 대체할 수 있음을 보였다 — 장면당 라벨링 시간을 몇 분에서 몇 초로 줄여, 개방형 어휘 시맨틱 매핑을 오프라인 후처리가 아니라 실시간 SLAM 시스템에 부착 가능한 실용적인 것으로 만들었다. 배치화된 투영/가시성 기법 또한 임의의 다중 뷰 시맨틱 융합 스택에 그대로 재사용될 수 있다.
관련 문서
- YOLO — 이 연구가 활용하는 실시간 검출 계보
- Grounding DINO — 텍스트 프롬프트 기반 개방형 어휘 2D 검출
- SAM — 추론 시점에 회피하는 세그멘테이션 파운데이션 모델
- ConceptGraphs — 빠른 라벨링으로부터 이득을 얻는 개방형 어휘 3D scene graph
- OpenScene — 점 수준 개방형 어휘 3D 이해
- Clio — 정확히 이런 종류의 빠른 라벨링을 필요로 하는 과제 지향적 개방형 집합 매핑