DETR
Carion 2020 · 論文
一行要約 — 物体検出を、二部マッチング損失で解かれるTransformerエンコーダ・デコーダによる直接的な集合予測問題として捉え、アンカー、NMS、手作業で設計された検出パイプラインを排除する。
問題
Faster R-CNNやYOLOのような古典的検出器は真にエンドツーエンドではない:それらはアンカー生成、非最大値抑制(NMS)、多段階の提案パイプラインといった、検出タスクに関する事前知識を明示的に符号化した手作業で設計された構成要素に依存しており、それぞれチューニングが必要である。これらが存在するのは、ネットワークが後から重複除去しなければならない多数のほぼ重複した候補ボックスを生成するためである。DETRは検出をクリーンな集合予測問題として定式化できるかを問う:1枚の画像を入力し、1つのネットワークが1つの損失で学習された(ボックス, クラス)ペアの集合を出力し、重複は後処理ではなく学習目的そのものによって抑制される。
手法とアーキテクチャ
順に3つの構成要素がある:CNNバックボーン(ResNet-50/101)が特徴マップを抽出し、それはフラット化され固定された位置エンコーディングが付加される;Transformerエンコーダ(ベースモデルでは6層、幅256、8ヘッド)が全空間位置に対して大域的自己注意を適用する;Transformerデコーダは個の学習された埋め込み——オブジェクトクエリ——を自己注意とエンコーダ・デコーダ間クロス注意を通じて変換し、個の物体を全て並列に(自己回帰的ではなく)デコードする;最後に共有のフィードフォワードネットワークが各出力埋め込みを正規化されたボックス座標とクラスラベルにマッピングし、特別な「物体なし」クラスを含む。は固定されており、典型的な物体数よりもはるかに大きい。各デコーダ層の後の補助的なHungarian損失が学習を助ける。
二部マッチング。 学習ではまず、個の予測とパディングされた正解集合との間で最低コストの一対一割り当てを見つける:
これはHungarianアルゴリズムで計算され、に対してマッチングコストはである。
Hungarian損失。 最適な割り当てが与えられると、損失はクラス予測に対する負の対数尤度とマッチされたペアに対するボックス損失の和になる:
クラス不均衡のための対数確率は係数10で重みが下げられる。ボックスは(アンカーに対するデルタとしてではなく)直接予測されるため、純粋な損失はスケールが悪くなる。そのためボックス損失はとスケール不変な一般化IoUを混合する:。一対一マッチングにより、学習中は重複予測がコストの高いものになる——そのため推論時にはNMSが不要である。
パノプティック拡張。 デコーダ出力にマスクヘッドを追加し、マスクスコアに対する画素単位のargmaxを取ることで、重複ヒューリスティックなしに「thing」と「stuff」を統一したパノプティックセグメンテーションが得られる。
実験結果
- COCO valにおいて、DETR(ResNet-50、4100万パラメータ、86 GFLOPS、28 FPS)は42.0 APに達し、大幅にチューニングされたFaster R-CNN-FPN+ベースライン(42.0 AP、4200万パラメータ)に匹敵する——これは大物体検出でのはるかに優れた性能によって達成されている( 61.1 対 53.4)が、小物体では劣る( 20.5 対 26.6)。DETR-DC5-R101は44.9 APに達する。
- 学習には500エポックが必要だった(400エポック時に学習率を下げる);長いスケジュールは短いものより1.5 AP追加する。アブレーション:エンコーダを取り除くと全体で3.9 AP、大物体で6.0 AP失われる——大域的自己注意が実際に有効な仕事をしている。
- パノプティックセグメンテーション:DETR-R101はCOCO valで45.1 PQを得る、対して同じ拡張で再学習されたPanopticFPN++ベースラインは44.1——特にstuffクラスで優位に立ち( 37.0 対 33.6)、COCO testでは46 PQを得る。
- リリース当初の主な弱点——遅い収束と小物体AP——はフォローアップ研究(Deformable DETR、DINO、RT-DETR)によって修正され、二部マッチング集合損失はあらゆる集合対集合の予測タスクの標準的な手法となった。
SLAMにおける意義
DETRは物体検出におけるTransformerの席巻を開始し、その後継(RT-DETR、DINO、Grounding DINO)は現代のセマンティックおよびオブジェクトレベルのSLAMシステムが基盤とする検出器である。その二部マッチングの発想は、キーポイント、セグメント、オブジェクトランドマークといった、あらゆる集合対集合の予測問題に一般化でき、学習型SLAMフロントエンドに繰り返し現れる。SLAMシステムがセマンティックマッピング、動的物体フィルタリング、シーングラフのために物体検出を必要とするとき、その検出器は非常に多くの場合DETRファミリーのモデルである。
関連ノート
- RT-DETR — YOLOクラスの検出器を上回るリアルタイムDETRバリアント
- Grounding DINO — オープンボキャブラリでテキストプロンプトによるDETR系子孫
- YOLO — DETRが対比される古典的リアルタイム検出器ファミリー
- SAM — DETR系検出器としばしば組み合わされるプロンプト可能なセグメンテーション