평가 지표
한 SLAM 시스템이 다른 시스템보다 “더 낫다”는 것을 어떻게 말할 수 있을까요? 커뮤니티의 답은 기준 진실(모션 캡처, GPS/INS, 또는 측량급 레퍼런스로부터)에 대해 계산되는 한 쌍의 궤적 오차 지표입니다: 전역 정확도를 위한 ATE와 지역 정확도를 위한 RPE입니다. 두 지표 모두 표준으로 쓰이는 이유는 서로 다른 실패 양상을 측정하기 때문입니다.
ATE: 절대 궤적 오차
ATE는 전체 궤적의 전역 일관성을 측정합니다. 추정 궤적 는 먼저 단일 강체 변환 (최소제곱으로 구함; 단안 시스템에서는 스케일을 관측할 수 없으므로 유사 변환)로 기준 진실 에 정렬됩니다. 그런 다음:
실무에서는 평행이동 부분을 미터 단위 RMSE로 보고합니다. 높은 ATE는 누적된 드리프트나 궤적을 전역적으로 뒤틀어 놓은 잘못된 루프 클로저를 나타냅니다.
RPE: 상대 자세 오차
RPE는 지역 정확도 — 단위 시간 또는 단위 거리당 드리프트 — 를 측정합니다. 구간 에 대한 상대 운동에 대해, (기준 진실)와 (추정값)일 때:
평행이동 부분과 회전 부분의 RMSE가 각각 보고됩니다 (예: % 평행이동 오차와 deg/m). KITTI의 공식 지표는 RPE의 한 변형입니다: 100–800m 부분 시퀀스에 대해 오차를 평균합니다.
왜 둘 다 필요한가
지역 추적은 훌륭하지만 루프 클로저가 없는 시각 오도메트리 시스템은 RPE는 낮지만 ATE는 끔찍할 수 있습니다; 공격적인(때로는 잘못된) 루프 클로저를 사용하는 시스템은 그 반대 양상을 보일 수 있습니다. ATE는 전역 맵의 정확성을 반영하고, RPE는 오도메트리 품질을 분리해서 보여주며 드리프트가 어디서 발생했는지에 둔감합니다. 논문을 비교할 때는 정렬 관례(SE(3) 대 Sim(3))도 확인해야 합니다 — 스케일이 정렬된 단안 수치는 미터 단위의 스테레오/VIO 수치와 비교할 수 없습니다.
표준 벤치마크
| 데이터셋 | 센서 | 환경 | 기준 진실 |
|---|---|---|---|
| KITTI Odometry | 스테레오 + LiDAR + IMU | 야외 주행 | GPS/INS |
| TUM RGB-D | RGB-D + IMU | 실내 핸드헬드 | 모션 캡처 |
| EuRoC MAV | 스테레오 + IMU | 실내 UAV | 모션 캡처 |
- KITTI: 기준 진실이 있는 11개 훈련 시퀀스와 11개의 보류된 테스트 시퀀스; 100–800m 길이의 모든 부분 시퀀스에 대해 평균낸 % 평행이동 및 회전 오차로 평가됩니다.
- TUM RGB-D: 다양한 난이도의 39개 시퀀스(정적 장면, 동적 물체, 모션 블러); ATE가 표준 지표이며, 이 데이터셋의 평가 스크립트가 두 지표 모두를 대중화시켰습니다.
- EuRoC: 두 건물에서 얻은, 단계별로 난이도가 올라가는 11개 시퀀스(V1_01 쉬움부터 V2_03 어려움까지); ATE와 RPE 모두 보고되며, IMU 데이터가 잘 동기화되어 있습니다 — VIO의 기본 검증장입니다.
도구
사실상의 표준 평가 도구는 evo로, 일반적인 궤적 형식(TUM, KITTI, EuRoC, ROS 백)을 읽어들이고 명시적인 정렬 제어와 함께 두 지표를 모두 계산합니다:
evo_ape tum groundtruth.txt estimate.txt -a # SE(3) 정렬을 사용한 ATE
evo_ape tum groundtruth.txt estimate.txt -as # ...Sim(3): 스케일도 정렬 (단안)
evo_rpe tum groundtruth.txt estimate.txt --delta 1 --delta_unit m # 미터당 RPE
스크립트에서 정렬 플래그를 명시적으로 지정해야 여러분의 수치가 발표된 결과와 비교 가능하게 유지됩니다.
결과 표를 읽을 때 (또는 만들 때) 주의할 함정
- 정렬 불일치 — Sim(3)로 정렬된 단안 ATE를 SE(3)로 정렬된 스테레오 ATE와 나란히 놓는 것은 공정한 비교가 아닙니다.
- 타임스탬프 연관 — 추정값과 기준 진실은 서로 다른 속도로 샘플링되며, 연관 허용 오차가 점수를 조용히 바꿔놓습니다.
- 비결정성 — 멀티스레드 SLAM 시스템은 실행마다 다른 궤적을 만들어냅니다; 진지한 평가는 한 번의 운 좋은 실행이 아니라 여러 번 실행한 통계를 보고합니다.
- 평균 속에 숨는 추적 실패 — 추적을 잃고 살아남은 조각만 보고하는 시스템은 속임수처럼 낮은 ATE를 낼 수 있습니다; 완전성과 실패율도 함께 보고해야 합니다.
- 지표는 평균만을 측정합니다 — ATE가 동일한 두 시스템도 불확실성 품질에서는 크게 다를 수 있습니다; 일관성을 참고하십시오.
정확도를 넘어, 진지한 평가는 실행 시간, 강건성(여러 실행에 걸친 추적 실패율), 그리고 확률적 추정기의 경우 일관성도 보고합니다 — 이는 궤적 지표만으로는 포착할 수 없습니다.
SLAM에서의 의미
ATE와 RPE는 이 분야의 공통 화폐입니다: 모든 SLAM 논문의 결과 표가 이를 바탕으로 만들어지므로, 문헌을 비판적으로 읽거나 자신의 시스템이 작동한다고 주장하려면 이들이 정확히 무엇을 측정하는지 — 그리고 무엇을 숨기는지 — 를 알아야 합니다. 이들은 또한 일상적인 엔지니어링 도구입니다: RPE의 퇴보는 프론트엔드/오도메트리를 가리키고, RPE는 안정적인데 ATE가 퇴보한다면 루프 클로저나 백엔드를 가리킵니다.