RF-DETR

Robinson 2025 · 论文

一句话总结 — 一种轻量级的专用检测Transformer(来自Roboflow + CMU),将DINOv2预训练骨干网络与端到端的权重共享神经架构搜索(NAS)相结合,使一次训练即可产出一整条可部署子网络的精度-延迟帕累托曲线——其2x-large变体是首个在COCO上突破60 AP的实时检测器。

问题

开放词汇的VLM检测器(GroundingDINO、YOLO-World)精度高,但速度太慢难以实时使用,且对分布外类别的泛化能力较差;专用的实时检测器(D-FINE、RT-DETR、YOLOv8/v11)速度快,但精度不及微调后的VLM——作者认为,这些专用检测器通过定制的架构、学习率调度器和数据增强调度器,实际上隐式地过拟合到了COCO,使模型偏向于类COCO的数据集统计特性。另外,各论文间的延迟基准测试也难以复现(例如,D-FINE报告称LW-DETR比LW-DETR自己报告的速度快25%),作者将此归因于GPU功耗节流(power throttling)。RF-DETR旨在将互联网规模的预训练与实时架构相结合,迁移到任意目标数据集,并在无需重新训练的情况下针对任意硬件预算进行特化。

方法与架构

基础模型对LW-DETR进行了现代化改造:一个预训练的ViT骨干网络通过交替的窗口/非窗口注意力模块提取多尺度特征;一个多尺度投影器(用层归一化替代批归一化,使消费级GPU上也能进行梯度累积)将特征送入一个可变形交叉注意力的DETR解码器;检测与分割损失应用于每一层解码器,因此推理时可以丢弃部分层。

实验结果

对SLAM的意义

语义SLAM需要在与跟踪、建图和优化相同的嵌入式GPU上同时运行检测器,因此检测器必须精确落在某个延迟预算内——RF-DETR的权重共享NAS把这件事从”挑一个最接近的YOLO尺寸”变成了”从一次训练中调出一个延迟落在目标值10%以内的子网络”,即便在部署之后计算预算发生变化也是如此。其端到端、无需NMS的设计(继承自DETR,并由RT-DETR实现实时化)相比NMS流水线能提供更可预测的单帧延迟,这对实时调度很重要;RF100-VL的结果与机器人应用直接相关,因为部署领域(仓库、农业、检测)与COCO相去甚远——而这正是SLAM中用于动态物体掩码的YOLO系检测器容易性能下降的地方。高精度实时检测与实例掩码可为动态物体移除、物体级地标和语义建图提供支持;论文中考虑功耗节流的延迟测试协议也值得任何机器人基准测试借鉴。不过反过来说,其局限也很明显:RF-DETR是一个闭集词汇的专用模型——需要针对每次部署进行微调,而不能像开放词汇检测器那样用文本提示。

相关条目