CoPeD
Zhou 2024 · 논문
한 줄 요약 — CoPeD는 공중-지상 로봇 팀을 중심으로 구축된, 포괄적인 실제 멀티로봇 협업 지각 데이터셋으로, 협업 지각 연구를 시뮬레이션에 갇혀 있게 만든 평가 공백을 메우기 위해 만들어졌다.
문제
지난 10년간 단일 로봇 지각은 눈에 띄는 발전을 이루었지만, 멀티로봇 협업 지각은 대체로 미개척 상태로 남아 있었다 — 그리고 주요 장벽 중 하나는 실제 데이터셋의 부재였다. 협업 지각은 센서 잡음, 가림, 그리고 완전한 센서 고장 하에서 로봇 간의 압축되고, 간헐적이고, 제한적이고, 이종적이고, 비동기적인 환경 정보를 융합해야 한다. 기존의 멀티로봇 데이터셋은 대부분 SLAM(로봇 간 시점 중첩이 제한적인 기하학적 매핑)을 위해 설계되었고, 협업 지각 데이터셋은 대부분 시뮬레이션이며 항공 시점이 없는 V2V 자율주행 벤치마크였다. CoPeD는 바로 이 공백을 메우기 위해 특별히 제작되었다.
방법 및 아키텍처
데이터셋 논문으로서 CoPeD의 “방법”은 수집, 캘리브레이션, 어노테이션 파이프라인이다(핵심 수식은 포함하지 않는다):
- 플랫폼 (지상 3대 + 항공 2대): Clearpath Warthog은 Ouster OS1-64 3D LiDAR, LORD Microstrain 3DM-GX5-25 IMU, u-Blox EVK-M8T GNSS, RealSense D435i/D455 스테레오 카메라, 두 대의 FLIR Blackfly S 카메라, 그리고 하드웨어 시간 동기화를 위한 Masterclock GMR1000을 탑재한다. Clearpath Jackal은 유사한 센서 스위트를 갖춘다. 커스텀 NYU-ARPL 쿼드로터는 전방 RealSense D435i, 하향 IMX219 컬러 카메라, PX4 오토파일럿, GPS를 탑재한다. 모든 로봇은 하나의 5G Wi-Fi 서브네트워크에서 NTP 시간 동기화를 사용해 ROS 1을 실행한다.
- 의도된 중첩을 갖는 시퀀스: 실내 ‘Indoor-NYUARPL’(38m × 60m 실험실/복도; 항공 1 + 지상 1 시퀀스 세 개, 그리고 2+2 시퀀스 하나. 항공 로봇은 지상 로봇보다 2m 높은 곳을 비행하고 지상 로봇은 0.5m/s로 이동)과 실외 ‘HOUSE’(150m × 30m), ‘FOREST’(100m × 80m)로, 팀이 공중-지상 서브팀으로 나뉘어 항공 로봇은 2–10m 고도로, 지상 로봇은 최대 1.5m/s로 이동한다. 시퀀스 중 하나는 편성 효과를 연구하기 위해 실행 중에 공중-지상 짝을 바꾸기도 한다. 비교를 위해 항공 로봇 단독 시퀀스도 여러 개 추가되었다.
- 포즈 어노테이션: 항공 로봇은 GPS와 OpenVINS 스테레오 시각-관성 오도메트리를 융합한다. 지상 로봇은 IMU + 휠 오도메트리를 사용한다. 로봇 간 상대 포즈는 지상 로봇에 부착된 8개의 AprilTag 묶음에서 얻으며, 항공 로봇의 하향 카메라로 검출하여 PnP로 풀어낸다. 내부/외부 파라미터는 Kalibr로 캘리브레이션하고, IMU 내부 파라미터는 Allan 공분산 분석으로, 공유 캘리브레이션 보드는 팀 전체의 시작 포즈를 정렬한다.
- 제로샷 지각 어노테이션: RAM + Grounding DINO + SAM으로부터의 시맨틱 인스턴스 마스크(후처리를 통한 2D 박스)를, 프레임 간 전파 모델로 시간적으로 일관되게 만든다. 단안 깊이 어노테이션은 ZoeDepth로부터 얻는다(RealSense의 짧은 스테레오 기선 때문에 고전적인 SGBM/그래프 컷 스테레오보다 현대적인 단안 깊이가 더 나은 성능을 보이기 때문에 선택됨).
- 실제 잡음의 보존: 색상 지터링, 시간적으로 불연속적인 LiDAR 강도, 실내와 숲 캐노피 아래에서의 GPS 단절/드리프트, 온도 의존적인 IMU 내부 파라미터, 그리고 클럭 동기화 손실 — 시뮬레이션이 숨기는 바로 그런 방해 요소들을 그대로 담고 있다.
실험 결과
논문의 평가는 정성적이다 — 그 기여는 인프라적인 것이다. 논문은 협업 지각 작업에서 데이터셋을 시연한다: 두 대의 항공 로봇과 한 대의 지상 로봇이 특징 맵을 공유하는 그래프 신경망 시스템이 멀티로봇 단안 깊이 추정과 시맨틱 분할을 수행하며, 멀리 있는 물체(깊이에서는 나무, 분할에서는 집)에 대한 예측을 복원하고, 단일 에이전트 베이스라인과 비교했을 때 한 로봇의 이미지 센서가 손상된 경우에도 강인성을 유지한다. 제로샷 시맨틱/깊이 어노테이션은 실내외 시퀀스 전반에 걸쳐 제시된다. 전체 시퀀스 표와 센서 사양은 논문을 참조하라. 데이터와 도구는 arplaboratory/CoPeD에 공개되어 있다.
SLAM에서의 의미
협업 SLAM 논문들은 역사적으로 가상 에이전트들에게 인위적으로 나눠준 단일 로봇 데이터셋으로 평가되어 왔는데, 이는 실제 배치의 어려운 부분들 — 비동기 센싱, 이종 플랫폼, 그리고 같은 장소에 대한 진짜로 다른 시점 — 을 숨긴다. CoPeD는 Kimera-Multi와 Swarm-SLAM 같은 C-SLAM 시스템에 EuRoC가 단일 로봇 VIO에 대해 했던 것과 같은 역할의, 현실적인 공중-지상 벤치마크를 제공한다 — 그리고 AprilTag 기반 로봇 간 실측값은 로봇 간 루프 클로저와 맵 병합 평가를 직접적으로 지원한다.
관련 문서
- Kimera-Multi — 이런 종류의 데이터셋이 벤치마크하는 분산 메트릭-시맨틱 C-SLAM 시스템
- Swarm-SLAM — 멀티로봇 데이터로 평가된 분산형 C-SLAM 프레임워크
- 로봇 간 루프 클로저 — 로봇 간 시점 중첩이 테스트하도록 설계된 능력
- 맵 병합 — 공중과 지상의 서브맵을 하나의 프레임으로 정렬하는 과정
- 통신 제약 — 데이터셋이 구현하는 실제 조건(간헐적이고 제한된 링크)