BLIP-2
Li (Salesforce) 2023 · 논문
한 줄 요약 — BLIP-2는 경량 Querying Transformer(Q-Former)를 사용하여 동결된 사전 훈련 이미지 인코더와 동결된 대형 언어 모델을 연결하여, 엔드투엔드 다중 모달 모델 대비 훈련 비용의 극히 일부만으로 강력한 비전-언어 능력을 달성합니다.
문제
비전-언어 사전 훈련의 비용은 대규모 모델의 엔드투엔드 훈련을 의미했기 때문에 감당하기 어려워졌습니다 — 새로운 VLM마다 수십억 개의 시각 및 언어 매개변수를 다시 훈련해야 했습니다. 그러나 강력한 재료들은 이미 기성품으로 존재했습니다: 각자의 모달리티에서 뛰어난 대형 사전 훈련 이미지 인코더와 LLM입니다. 미해결 질문은 이미지를 한 번도 본 적 없는 LLM에 시각 정보를 주입하는 모달리티 격차를 작은 훈련 가능 모듈이 — 두 거대 모델 중 어느 것도 동결을 해제하지 않고, 동결 해제가 야기하는 치명적 망각 없이 — 연결할 수 있는지였습니다.
방법 및 아키텍처
Q-Former. 유일한 훈련 가능 모듈(1억 8800만 매개변수, BERT-base로부터 초기화)이 동결된 이미지 인코더와 동결된 LLM 사이에 위치합니다. 동일한 셀프 어텐션 레이어를 공유하는 두 개의 Transformer 서브모듈로 구성됩니다: 입력이 동결된 이미지 인코더의 출력 특징에 교차 어텐션하는(한 블록마다 교차 어텐션 삽입) 고정된 32개의 학습 가능한 쿼리 임베딩(차원 768) 집합인 이미지 Transformer와, 텍스트 인코더 또는 디코더 역할을 하는 텍스트 Transformer입니다. 입력 해상도가 어떻든 쿼리는 이미지를 32개의 출력 벡터 로 압축합니다 — 언어와 가장 관련 있는 시각적 내용을 추출하도록 강제되는 정보 병목입니다.
1단계 — 비전-언어 표현 학습(동결된 이미지 인코더 + Q-Former, 이미지-텍스트 쌍에 대해), 어텐션 마스크만 다른 세 가지 목적 함수를 공동으로 최적화합니다:
- 이미지-텍스트 대조(ITC): 를 [CLS] 텍스트 임베딩 와 정렬합니다; 이미지-텍스트 유사도는 쿼리에 대한 최댓값 이며, 단일 모달 마스크(쿼리와 텍스트가 서로를 보지 못함)를 사용해 배치 내 부정 예제와 대조됩니다.
- 이미지 기반 텍스트 생성(ITG): 다중 모달 인과 마스크로 캡션을 생성합니다 — 텍스트 토큰이 모든 쿼리에 어텐션하므로, 캡션과 관련된 모든 정보가 쿼리를 통과해야 합니다.
- 이미지-텍스트 매칭(ITM): 양방향 마스크와 하드 네거티브 마이닝을 사용한 매칭/비매칭 이진 분류입니다.
2단계 — 동결된 LLM으로부터의 생성적 학습. 단일 완전 연결 계층이 를 LLM의 임베딩 차원으로 투영합니다; 투영된 쿼리는 소프트 시각 프롬프트로서 텍스트 앞에 붙습니다. 디코더 LLM(OPT 2.7B/6.7B)은 언어 모델링 손실로 훈련되고, 인코더-디코더 LLM(FlanT5-XL/XXL)은 prefix-LM 손실로 훈련됩니다. 1단계에서 이미 가 언어적으로 유의미해졌기 때문에 LLM이 정렬을 학습해야 하는 부담이 작아, 치명적 망각이 완화됩니다.
훈련. 동결된 인코더: CLIP ViT-L/14 또는 EVA-CLIP ViT-g/14(마지막에서 두 번째 레이어 특징). 데이터: 1억 2900만 개 이미지(COCO, Visual Genome, CC3M, CC12M, SBU, LAION-400M에서 가져온 1억 1500만 개)와 CapFilt 합성 캡션. 250k 스텝(1단계) + 80k 스텝(2단계); 가장 큰 모델(ViT-g + FlanT5-XXL)은 단일 16×A100(40G) 머신에서 6일 + 3일 미만으로 사전 훈련됩니다.
실험 결과
제로샷 개요(BLIP-2의 훈련 가능 매개변수는 1억 8800만 개):
| 모델 | 훈련 가능 매개변수 | VQAv2 (test-dev) | NoCaps CIDEr | Flickr TR@1 / IR@1 |
|---|---|---|---|---|
| Flamingo | 10.2B | 56.3 | – | – |
| BLIP | 583M | – | 113.2 | 96.7 / 86.7 |
| BLIP-2 | 188M | 65.0 | 121.6 | 97.6 / 89.7 |
- 핵심 결과: BLIP-2(ViT-g, FlanT5-XXL)는 54배 적은 훈련 가능 매개변수로 제로샷 VQAv2에서 Flamingo80B를 8.7% 앞섭니다(65.0 대 56.3 test-dev); GQA(44.7)에서도 선두이며, 지식 집약적인 OK-VQA에서는 Flamingo80B에만 뒤처집니다(45.9 대 50.6).
- 스케일링 애블레이션: 더 강력한 이미지 인코더(ViT-g > ViT-L)나 더 강력한/명령어 튜닝된 LLM(FlanT5 > OPT, 큰 것 > 작은 것) 모두 성능을 향상시킵니다 — BLIP-2가 두 커뮤니티의 발전을 모두 흡수하는 범용적인 방법론임을 입증합니다.
- 1단계 표현 학습을 제거하면 두 LLM 유형 모두에서 제로샷 VQA 성능이 붕괴하며, OPT는 치명적 망각을 보입니다 — 이는 LLM이 아니라 Q-Former 병목이 정렬을 수행한다는 증거입니다.
- 명령어 튜닝된 FlanT5를 사용하면 BLIP-2는 명령어 기반 제로샷 이미지-텍스트 생성 능력의 창발을 보입니다: 시각적 대화, 시각적 지식/상식 추론, 스토리텔링.
SLAM에서의 의미
BLIP-2의 동결된 인코더 + 경량 어댑터 + 동결된 LLM 패턴은 비전-언어 시스템을 저비용으로 구축하는 표준 방법론이 되었으며(InstructBLIP, MiniGPT-4, 다수의 로보틱스 VLM), 공간 시스템에 언어 기반 추론을 추가하는 실용적인 경로를 정의합니다: 거대 모델을 다시 훈련하는 대신, 작은 다리 하나로 SLAM 시스템의 시각(또는 렌더링된 맵) 특징을 기성 LLM에 연결할 수 있습니다. 이 레벨을 관통하는 VLM에서 VLA로의 계보에서, BLIP-2는 CLIP의 대조 임베딩과 LLaVA/OpenVLA의 명령어 추종 스택 사이에 위치하는 효율성 이정표입니다.