RF-DETR

Robinson 2025 · 논문

한 줄 요약 — (Roboflow + CMU에서 나온) 경량 특화 검출 transformer로, DINOv2 사전학습 백본과 종단간 weight-sharing 신경망 아키텍처 탐색(NAS)을 결합하여 한 번의 학습만으로 배포 가능한 sub-net들의 정확도-지연시간 파레토 곡선 전체를 얻어내며 — 2x-large 변형은 COCO에서 60 AP를 넘은 최초의 실시간 검출기입니다.

문제

개방형 어휘 VLM 검출기(GroundingDINO, YOLO-World)는 정확하지만 실시간 사용에는 너무 느리고 분포 외(out-of-distribution) 클래스에는 일반화가 잘 안 됩니다; 특화된 실시간 검출기(D-FINE, RT-DETR, YOLOv8/v11)는 빠르지만 미세조정된 VLM보다 성능이 떨어지는데 — 저자들은 이들이 맞춤형 아키텍처, 학습률 스케줄러, 증강 스케줄러를 통해 암묵적으로 COCO에 과적합되어 모델을 COCO와 유사한 데이터셋 통계로 편향시켰다고 주장합니다. 별개로, 논문 간 지연시간 벤치마킹은 재현이 불가능한데(예: D-FINE은 LW-DETR이 LW-DETR 자신이 보고한 것보다 25% 더 빠르다고 보고합니다), 저자들은 이를 GPU 전력 스로틀링(throttling) 탓으로 추적합니다. RF-DETR은 인터넷 규모의 사전학습을 실시간 아키텍처와 결합하고, 어떤 대상 데이터셋으로도 전이하며, 재학습 없이 어떤 하드웨어 예산에도 특화되는 것을 목표로 합니다.

방법 및 아키텍처

기본 모델은 LW-DETR을 현대화한 것입니다: 사전학습된 ViT 백본이 windowed / non-windowed 어텐션 블록을 번갈아 사용해 다중 스케일 특징을 추출하고; 다중 스케일 프로젝터(소비자용 GPU에서 그래디언트 누적을 가능하게 하는, batch norm 대신 layer norm)가 deformable-cross-attention DETR 디코더에 입력되며; 검출과 세그멘테이션 손실이 모든 디코더 레이어에 적용되어 추론 시 레이어를 제거할 수 있습니다.

실험 결과

SLAM에서의 의미

시맨틱 SLAM은 동일한 임베디드 GPU에서 추적, 매핑, 최적화와 나란히 검출기를 실행하므로, 검출기는 정확한 지연시간 예산 안에 들어와야 합니다 — RF-DETR의 weight-sharing NAS는 이를 “가장 가까운 YOLO 크기를 고른다”에서 “한 번의 학습으로부터 목표 지연시간의 10% 이내인 sub-net을 다이얼로 맞춘다”로 바꾸며, 배포 후 연산 예산이 바뀌는 경우에도 마찬가지입니다. DETR에서 물려받아 RT-DETR이 실시간화한 종단간 NMS 없는 설계는 NMS 파이프라인보다 프레임당 지연시간을 더 예측 가능하게 만들어 주며, 이는 실시간 스케줄링에 중요합니다; RF100-VL 결과는 배포 도메인(창고, 농업, 검사)이 COCO와 전혀 다르게 생긴 로보틱스에 직접적으로 시사하는 바가 있습니다 — 바로 SLAM에서 동적 객체 마스킹에 사용되는 YOLO 계열 검출기가 성능 저하를 겪는 지점입니다. 고정확도 실시간 검출과 인스턴스 마스크는 동적 객체 제거, 객체 수준 랜드마크, 시맨틱 매핑에 활용되며; 논문의 전력 스로틀링을 인식한 지연시간 프로토콜은 어떤 로보틱스 벤치마크에도 채택할 가치가 있습니다. 유의점도 있습니다: RF-DETR은 닫힌 어휘(closed-vocabulary) 특화 모델입니다 — 개방형 어휘 검출기처럼 텍스트로 프롬프트하는 대신 배포마다 미세조정해야 합니다.

관련 문서