CLIP
Radford (OpenAI) 2021 · 論文
一行要約 — CLIPは、画像エンコーダとテキストエンコーダを4億件のウェブ画像-テキストペア上で対称な対比学習の目的関数によって共同学習し、共有埋め込み空間を生み出す。これにより、自然言語で記述された実質的に任意の概念のゼロショット視覚認識が可能になる。
問題
最先端の視覚システムは、あらかじめ定められた固定の物体カテゴリ集合(典型的にはImageNetの1000クラス)を予測するように学習されていた。この制限された教師信号は汎用性を制限する。それ以外の任意の視覚概念を指定するには、新しいラベル付きデータを収集して再学習する必要がある。キャプションはすでにインターネット規模で画像に付随して無償に得られる——しかしキャプションの正確な単語を予測すること(VirTexスタイル)はスケーリングが悪い。著者らのキャプション予測ベースラインは、bag-of-wordsベースラインよりもImageNet認識の学習が3倍遅く、対比学習の目的関数に切り替えることでさらに4倍の効率向上が得られた。CLIPは、この弱くノイジーなペアリング信号が十分な規模であれば、任意のタスクにゼロショットで転移する視覚表現を学習できるかを問う。
手法とアーキテクチャ
データ。 WIT (WebImageText): インターネットから50万個のクエリを用いて収集された4億件の(画像, テキスト)ペア。1クエリあたり最大2万ペアでクラスバランスが取られている。
デュアルエンコーダ。 画像エンコーダ(5種類のResNet: RN50からアテンションプーリング付きRN50x64まで、および3種類のViT: B/32、B/16、L/14)とテキストエンコーダ(6300万パラメータ、12層、幅512のTransformer、小文字化されたBPE、語彙数49,152、最大長76。[EOS]の活性がテキスト特徴となる)がゼロから学習される。それぞれの表現は線形に共有埋め込み空間へ射影される——非線形な射影ヘッドはない。
対比学習の目的関数。 個のペアからなるバッチが与えられたとき、CLIPは個の可能なペアリングのうちどれが実際に発生したかを予測する。すなわち、個の正しいペアのコサイン類似度を最大化し、個の誤ったペアの類似度を最小化する。これは類似度スコアに対する対称なクロスエントロピー(マルチクラスN-pair / InfoNCE損失)によって実現される。論文の図3の疑似コードに従い、正規化された埋め込み (画像)と (テキスト)、学習された温度 を用いると: であり、各CEは一致するインデックスをラベルとしたソフトマックスクロスエントロピーであり、それぞれ行方向・列方向に取られる。は対数パラメータ化されたスカラーとして学習される(初期値0.07、logitsは100でクリップされる)。バッチサイズは32,768。最大のResNetは592台のV100で18日、ViT-L/14は256台のV100で12日を要し、さらに336pxで1エポック追加学習される(ViT-L/14@336px、報告されている「CLIP」)。
ゼロショット転移。 テスト時には、データセットのクラス名が(“A photo of a {label}.”のようなプロンプトテンプレートを用いて)埋め込まれ、画像は最も近いテキスト埋め込みに分類される——テキストエンコーダは、線形分類器の重みを生成するハイパーネットワークとして機能する。プロンプトエンジニアリングと80個のプロンプトのアンサンブルにより、ImageNet精度がほぼ5%向上する。
実験結果
- ゼロショットImageNet: 76.2%——1.28Mの学習例を一切使わずに、元の教師あり学習のResNet-50に匹敵する(top-5: 95%、Inception-V4に匹敵)。
- 27個のデータセットにわたり、ゼロショットのCLIPは、ResNet-50特徴に対する完全教師あり方式のロジスティック回帰を27個中16個で上回る。STL10ではゼロショットで99.3%と学習例なしで最先端を達成。動画行動認識では+14.5%(Kinetics700)、+7.7%(UCF101)で勝る。
- 線形プロービング: CLIPの特徴は、最良のImageNetモデル(Noisy Student EfficientNet-L2)を27個中21個のデータセットで上回り、OCR、地理位置推定、活動認識で最大の向上を示す。
- ロバスト性: 7つの自然な分布シフト(ImageNetV2、ImageNet-R、ObjectNet、…)において、ゼロショットのCLIPはロバスト性ギャップを**最大75%**縮小する。ImageNetへの適応はImageNet精度を9.2%向上させるが、その実効的なロバスト性を損なう。
- ゼロショット検索は、Flickr30kとMSCOCOのテキスト検索において、先行するすべてのゼロショット結果に匹敵するかそれを上回る。
SLAMにおける意義
CLIPはオープンボキャブラリSLAMを実現する技術である。CLIP特徴を3Dマップの要素に付加することで、LERFやConceptFusionのようなシステムは、固定された検出器クラスリストの代わりに、自由形式のテキスト(「消火器を探して」)で再構成されたシーンを問い合わせられるようになる。CLIPはまた、現代のロボットアーキテクチャで次第にSLAMの上位に位置するVLM/VLAスタック(BLIP-2、LLaVA、OpenVLA)の上流でもある。視覚言語事前学習にとって、BERTがNLPにとってそうであったのと同様に、CLIPは基準点であり、SigLIPはその直接の技術的後継である。