RF-DETR
Robinson 2025 · 논문
한 줄 요약 — (Roboflow + CMU에서 나온) 경량 특화 검출 transformer로, DINOv2 사전학습 백본과 종단간 weight-sharing 신경망 아키텍처 탐색(NAS)을 결합하여 한 번의 학습만으로 배포 가능한 sub-net들의 정확도-지연시간 파레토 곡선 전체를 얻어내며 — 2x-large 변형은 COCO에서 60 AP를 넘은 최초의 실시간 검출기입니다.
문제
개방형 어휘 VLM 검출기(GroundingDINO, YOLO-World)는 정확하지만 실시간 사용에는 너무 느리고 분포 외(out-of-distribution) 클래스에는 일반화가 잘 안 됩니다; 특화된 실시간 검출기(D-FINE, RT-DETR, YOLOv8/v11)는 빠르지만 미세조정된 VLM보다 성능이 떨어지는데 — 저자들은 이들이 맞춤형 아키텍처, 학습률 스케줄러, 증강 스케줄러를 통해 암묵적으로 COCO에 과적합되어 모델을 COCO와 유사한 데이터셋 통계로 편향시켰다고 주장합니다. 별개로, 논문 간 지연시간 벤치마킹은 재현이 불가능한데(예: D-FINE은 LW-DETR이 LW-DETR 자신이 보고한 것보다 25% 더 빠르다고 보고합니다), 저자들은 이를 GPU 전력 스로틀링(throttling) 탓으로 추적합니다. RF-DETR은 인터넷 규모의 사전학습을 실시간 아키텍처와 결합하고, 어떤 대상 데이터셋으로도 전이하며, 재학습 없이 어떤 하드웨어 예산에도 특화되는 것을 목표로 합니다.
방법 및 아키텍처
기본 모델은 LW-DETR을 현대화한 것입니다: 사전학습된 ViT 백본이 windowed / non-windowed 어텐션 블록을 번갈아 사용해 다중 스케일 특징을 추출하고; 다중 스케일 프로젝터(소비자용 GPU에서 그래디언트 누적을 가능하게 하는, batch norm 대신 layer norm)가 deformable-cross-attention DETR 디코더에 입력되며; 검출과 세그멘테이션 손실이 모든 디코더 레이어에 적용되어 추론 시 레이어를 제거할 수 있습니다.
- 인터넷 규모 사전 정보 — LW-DETR의 CAEv2 백본(10개 레이어, patch 16)을 DINOv2(12개 레이어)로 교체합니다; DINOv2 가중치로 초기화하면 소규모 데이터셋에서 눈에 띄게 도움이 됩니다. 낮은 학습률(), 0.1의 그래디언트 클리핑, 레이어별 0.8의 학습률 감쇠가 사전학습된 지식을 보존합니다; 추가적인 Objects-365 사전학습이 느려진 최적화를 보완합니다.
- 종단간 Weight-sharing NAS — 매 학습 반복마다 탐색 공간에서 모델 구성을 균등하게 샘플링하여 하나의 그래디언트 업데이트를 수행함으로써 수천 개의 sub-net을 병렬로 학습시킵니다(dropout 스타일 앙상블과 유사하게 정규화 역할도 하는 일종의 “아키텍처 증강”). 조정 가능한 다섯 가지 축: patch 크기(크기 간 FlexiViT 스타일 보간), 디코더 레이어 수(레이어별 손실 덕분에 제거 가능 — 디코더 전체를 제거하면 RF-DETR은 단일 단계 검출기가 됩니다), query 토큰 수(테스트 시 각 토큰의 클래스 로짓의 최댓값 시그모이드로 순위를 매겨 제거됨; 파레토 최적 개수는 이미지당 객체 수 통계를 암묵적으로 인코딩합니다), 이미지 해상도(최대 해상도/최소 patch 크기에서 미리 할당된 위치 임베딩을 아래로 보간), 어텐션 블록당 윈도우 수. 탐색은 학습 이후에 이루어집니다: 검증 세트에서 구성들에 대한 그리드 탐색을 수행하며 재학습이 필요 없습니다 — 학습 중 한 번도 샘플링되지 않은 sub-net(예: patch 크기 27과 18)조차 잘 동작합니다.
- 스케줄러 없는 학습 — (고정된 최적화 기간을 가정하는) cosine 학습률 스케줄도, 증강 스케줄도 사용하지 않습니다; 증강은 수평 뒤집기와 랜덤 크롭으로 제한됩니다(예를 들어 VerticalFlip은 주행 상황에서 물웅덩이 반사로 인한 오탐을 유발할 수 있습니다), 패딩을 최소화하기 위해 배치 단위 리사이징을 사용합니다. 가중치의 EMA가 학습률 스케줄러를 대체합니다.
- RF-DETR-Seg — 경량 인스턴스 세그멘테이션 헤드가 프로젝터 출력을 픽셀 임베딩 맵으로 이중선형(bilinear) 보간합니다; 마스크는 (각 디코더 레이어에서 나온) FFN으로 투영된 query 임베딩과 그 맵의 내적으로, YOLACT 스타일 프로토타입으로 해석할 수 있습니다. SAM 2 마스크로 pseudo-label된 Objects-365에서 사전학습됩니다.
- 표준화된 지연시간 프로토콜 — 순전파 사이에 200ms의 버퍼링을 두면 NVIDIA T4(TensorRT 10.4, CUDA 12.4)에서 전력 스로틀링을 방지할 수 있으며, 정확도와 지연시간은 반드시 동일한 모델 아티팩트에서 보고되어야 합니다: 단순한 FP16 양자화는 D-FINE을 0.5 AP까지 떨어뜨리고, YOLOv8/v11은 FP32에서 FP16으로 갈 때 정확도를 잃습니다.
실험 결과
- COCO 검출(val): RF-DETR(nano)은 2.3ms에서 48.0 AP를 기록하여, 비슷한 지연시간에서 D-FINE(nano, 42.7 AP)을 5.3 AP 앞서고 YOLOv8/v11 medium과 대등합니다; small은 3.5ms에서 52.9 AP; medium은 4.4ms에서 54.7 AP; 2x-large는 17.2ms에서 60.1 AP에 도달합니다 — COCO에서 60 AP를 넘은 최초의 실시간 검출기입니다. 파레토 곡선 상의 모든 지점은 단 한 번의 학습 실행에서 나온 것입니다.
- RF100-VL(다양한 실세계 데이터셋 100개): RF-DETR(2x-large)은 **15.6ms에서 63.3 AP(선택적 미세조정 시 63.5)**를 기록하여, 미세조정된 GroundingDINO(tiny, 309.9ms에서 62.3 AP)를 1.2 AP 앞서면서도 더 빠르게 실행됩니다; YOLOv8/v11은 정체되어 있고 더 크게 스케일링해도 도움이 되지 않으며, D-FINE은 AP50에서 RT-DETR에 뒤처집니다 — COCO 과적합의 증거입니다.
- COCO 인스턴스 세그멘테이션: RF-DETR-Seg(nano)는 3.4ms에서 40.3 mask AP를 얻어, 보고된 모든 크기의 YOLOv8/v11과 FastInst(34.9 AP)를 5.4만큼 앞서면서도 거의 더 빠르게 실행됩니다; medium(45.3 AP, 5.9ms)은 MaskDINO(46.3 AP, 242ms)에 근접합니다.
- Ablation(COCO, medium): 더 온건한 하이퍼파라미터는 LW-DETR 대비 1.0 AP를 잃게 하고(52.6 → 51.6), DINOv2 백본이 +2.0(53.6)을 회복시키며, Objects-365 사전학습이 +0.7(54.3)을 더하고, weight-sharing NAS가 +0.3(54.6)을 더합니다 — 결과적으로 동일한 지연시간에서 LW-DETR 대비 순 +2 AP이며, NAS로 찾아낸 구성은 COCO에서 별도의 미세조정이 필요 없습니다.
- 백본 ablation: DINOv2 ViT-S/14(54.3 AP, 4.7ms)는 CAEv2(52.3), SigLIPv2 ViT-B/32(50.4), 그리고 SAM 2의 Hiera-S(53.6 AP이지만 11.2ms — TensorRT의 Flash-Attention 커널이 plain ViT에 유리해지면 Hiera의 속도 우위 주장은 성립하지 않습니다)를 앞섭니다.
- 발견된 구성: COCO 파레토 계열은 nano(해상도 384, patch 16, 디코더 레이어 2개, DINOv2-S)부터 2x-large(해상도 880, patch 20, 디코더 레이어 5개, DINOv2-B)까지 이어지며, 모두 300개의 query를 사용합니다 — NAS는 파라미터 수가 아니라 해상도, patch 크기, windowing, 깊이를 트레이드오프합니다.
SLAM에서의 의미
시맨틱 SLAM은 동일한 임베디드 GPU에서 추적, 매핑, 최적화와 나란히 검출기를 실행하므로, 검출기는 정확한 지연시간 예산 안에 들어와야 합니다 — RF-DETR의 weight-sharing NAS는 이를 “가장 가까운 YOLO 크기를 고른다”에서 “한 번의 학습으로부터 목표 지연시간의 10% 이내인 sub-net을 다이얼로 맞춘다”로 바꾸며, 배포 후 연산 예산이 바뀌는 경우에도 마찬가지입니다. DETR에서 물려받아 RT-DETR이 실시간화한 종단간 NMS 없는 설계는 NMS 파이프라인보다 프레임당 지연시간을 더 예측 가능하게 만들어 주며, 이는 실시간 스케줄링에 중요합니다; RF100-VL 결과는 배포 도메인(창고, 농업, 검사)이 COCO와 전혀 다르게 생긴 로보틱스에 직접적으로 시사하는 바가 있습니다 — 바로 SLAM에서 동적 객체 마스킹에 사용되는 YOLO 계열 검출기가 성능 저하를 겪는 지점입니다. 고정확도 실시간 검출과 인스턴스 마스크는 동적 객체 제거, 객체 수준 랜드마크, 시맨틱 매핑에 활용되며; 논문의 전력 스로틀링을 인식한 지연시간 프로토콜은 어떤 로보틱스 벤치마크에도 채택할 가치가 있습니다. 유의점도 있습니다: RF-DETR은 닫힌 어휘(closed-vocabulary) 특화 모델입니다 — 개방형 어휘 검출기처럼 텍스트로 프롬프트하는 대신 배포마다 미세조정해야 합니다.
관련 문서
- DETR — 이 계열이 유래한 종단간 NMS 없는 검출 transformer
- RT-DETR — 실시간에 도달한 최초의 DETR; RF-DETR은 그 후속작인 LW-DETR을 기반으로 합니다
- YOLO — RF-DETR이, 특히 COCO 밖에서, 능가하는 고전적인 실시간 검출기 계열
- Grounding DINO — RF-DETR이 의 속도로 능가하는 미세조정된 개방형 어휘 기준선
- SAM 2 — RF-DETR-Seg의 Objects-365 사전학습을 위한 pseudo-label 마스크를 제공합니다