BLIP-2

Li (Salesforce) 2023 · 論文

一行要約 — BLIP-2は、凍結された事前学習済み画像エンコーダと凍結された大規模言語モデルを、軽量なQuerying Transformer(Q-Former)で橋渡しし、エンドツーエンドのマルチモーダルモデルのごく一部の学習コストで強力な視覚言語能力を実現する。

問題

視覚言語事前学習のコストは、大規模モデルのエンドツーエンド学習を意味するために手が届かないほど高くなっていた——新しいVLMはそれぞれ数十億の視覚パラメータと言語パラメータを再学習していた。しかし、市販の強力な部品はすでに存在していた。大規模な事前学習済み画像エンコーダとLLMは、それぞれ自身のモダリティにおいて優れていた。未解決の問いは、小さな学習可能なモジュールがモダリティギャップ——画像を見たことのないLLMに視覚情報を投入すること——を、どちらの巨大モデルも凍結を解かずに、また凍結解除が引き起こす致命的な忘却なしに、橋渡しできるかどうかであった。

手法とアーキテクチャ

Q-Former。 唯一の学習可能なモジュール(1.88億パラメータ、BERT-baseから初期化)が、凍結された画像エンコーダと凍結されたLLMの間に位置する。これは同じセルフアテンション層を共有する2つのトランスフォーマーサブモジュールを持つ。画像トランスフォーマーは、固定された32個の学習可能なクエリ埋め込み(次元768)を入力とし、凍結された画像エンコーダの出力特徴に対して交差注意を行う(交差注意は1ブロックごとに挿入される)。テキストトランスフォーマーはテキストエンコーダまたはデコーダとして機能する。入力解像度にかかわらず、クエリは画像を32個の出力ベクトル ZZ に圧縮する——言語に最も関連する視覚コンテンツを抽出せざるを得ない情報ボトルネックである。

ステージ1——視覚言語表現学習(凍結画像エンコーダ + Q-Former、画像-テキストペア上)。注意マスクのみが異なる3つの目的関数を同時に最適化する。

ステージ2——凍結LLMからの生成学習。 単一の全結合層が ZZ をLLMの埋め込み次元に射影する。射影されたクエリはソフト視覚プロンプトとしてテキストの前に付加される。デコーダ型LLM(OPT 2.7B/6.7B)は言語モデリング損失で学習され、エンコーダ・デコーダ型LLM(FlanT5-XL/XXL)はプレフィックスLM損失で学習される。ステージ1が既に ZZ を言語に有益なものにしているため、LLMがアラインメントを学ぶ負担は小さく、致命的な忘却が緩和される。

学習。 凍結エンコーダ: CLIP ViT-L/14またはEVA-CLIP ViT-g/14(最後から2番目の層の特徴)。データ: 1.29億枚の画像(COCO、Visual Genome、CC3M、CC12M、SBU、LAION-400Mからの1.15億枚)にCapFiltによる合成キャプションを付加。25万ステップ(ステージ1)+8万ステップ(ステージ2)。最大のモデル(ViT-g + FlanT5-XXL)は、単一の16×A100(40G)マシン上で6日+3日未満で事前学習される。

実験結果

ゼロショットの概観(BLIP-2の学習可能パラメータは1.88億):

モデル学習可能パラメータVQAv2 (test-dev)NoCaps CIDErFlickr TR@1 / IR@1
Flamingo102億56.3
BLIP5.83億113.296.7 / 86.7
BLIP-21.88億65.0121.697.6 / 89.7

SLAMにおける意義

BLIP-2の凍結エンコーダ+軽量アダプタ+凍結LLMというパターンは、視覚言語システムを安価に構築するための標準的な手法となった(InstructBLIP、MiniGPT-4、多くのロボティクスVLM)。そしてこれは、言語ベースの推論を空間システムに追加する実用的な道筋を定義する——巨大なモデルを再学習する代わりに、小さな橋渡しモジュールがSLAMシステムの視覚(またはレンダリングされたマップ)特徴を市販のLLMに接続できる。このレベルを通貫するVLMからVLAへの系譜において、BLIP-2は、CLIPの対比埋め込みとLLaVA/OpenVLAの指示追従型スタックの間に位置する効率性のマイルストーンである。

関連ノート