LLaVA
Liu 2023 · 논문
한 줄 요약 — LLaVA(Large Language and Vision Assistant)는 동결된 CLIP 비전 인코더를 단일 선형 투영을 통해 Vicuna LLM에 연결하고 GPT-4가 생성한 시각적 명령 데이터로 명령 튜닝을 수행하여, 강력한 오픈소스 대화형 VLM의 핵심이 아키텍처의 복잡성이 아니라 데이터의 품질임을 보여줍니다.
문제
기계 생성 명령 따르기 데이터로 LLM을 명령 튜닝하는 것은 새로운 언어 작업에 대한 제로샷 능력을 극적으로 향상시켰지만, 이 아이디어는 다중 모달 분야에서는 거의 탐구되지 않았습니다. 당시의 VLM들은 막대한 컴퓨팅을 요구했거나(Flamingo), 복잡한 연결 아키텍처를 사용했거나(BLIP-2의 Q-Former, Flamingo의 게이트형 교차 어텐션), 비공개였습니다(GPT-4V) — 그리고 대규모로 다중 모달 대화 데이터를 수동으로 레이블링하는 것은 비용이 많이 들고 잘 정의되지 않습니다. LLaVA는 최소한의 아키텍처와 기계 생성 다중 모달 명령 데이터의 조합이 경쟁력 있고 재현 가능한 오픈 VLM을 만들어낼 수 있는지를 묻습니다.
방법 및 아키텍처
- GPT 지원 데이터 생성: 언어 전용 GPT-4에게 COCO 이미지의 두 가지 기호적 표현 — 캡션과 객체 경계 상자 좌표 — 을 프롬프트로 제공하고, 세 가지 응답 유형을 생성하도록 요청합니다: 다중 턴 대화(58K), 상세 설명(23K), 복잡한 추론(77K), 총 158K개의 언어-이미지 명령 따르기 샘플입니다. 맥락 내 학습을 위한 몇 개의 수동 설계 시드 예제만이 인간 주석입니다.
- 아키텍처: 입력 이미지 는 사전 훈련된 CLIP ViT-L/14 인코더 (마지막 Transformer 레이어 전의 그리드 특징)를 통과하며, 하나의 훈련 가능한 투영 행렬 가 특징을 Vicuna LLM 의 단어 임베딩 공간으로 매핑합니다:
시각 토큰 는 단순히 LLM의 맥락에 텍스트와 함께 배치됩니다 — Q-Former나 교차 어텐션 모듈이 없습니다.
- 훈련 목적 함수: 다중 턴 데이터 는 단일 시퀀스로 직렬화되며, 모델은 어시스턴트 토큰에 대해서만 자기회귀적으로 훈련됩니다:
여기서 와 는 현재 예측 토큰 이전의 명령 토큰과 답변 토큰입니다.
- 2단계 훈련: 1단계 (특징 정렬) — 595K개의 이미지-텍스트 쌍으로 필터링된 CC3M을, 소박한 단일 턴 명령으로 취급합니다; 두 백본 모두 동결되고 만 훈련됩니다(1 epoch, lr 2e-3, 배치 128) — 실질적으로 동결된 LLM을 위한 시각 토크나이저를 학습하는 것입니다. 2단계 (종단 간 미세 조정) — 비전 인코더는 동결 상태를 유지하며; 가 158K개의 명령 세트에서 훈련됩니다(3 epoch, lr 2e-5, 배치 32) (8×A100).
- 평가 프로토콜: GPT-4가 실측 설명이 주어진 텍스트 전용 GPT-4가 생성한 참조 답변과 비교하여 후보 답변을 판정하고, 상대 점수를 산출합니다 — 논문이 도입한 LLaVA-Bench (COCO)와 LLaVA-Bench (In-the-Wild) 벤치마크의 기반입니다.
실험 결과
- LLaVA-Bench (COCO)(90개 질문): 전체 데이터 LLaVA는 텍스트 전용 GPT-4 대비 상대 점수 **85.1%**를 기록합니다; 명령 튜닝을 제거하면 점수가 21.5로 붕괴하며(−63.6), 대화 전용 훈련은 73.8을 줍니다 — 데이터 조합이 중요합니다.
- LLaVA-Bench (In-the-Wild)(24개 이미지, 60개 질문): LLaVA는 전체적으로 67.3 ± 2.0에 도달하며, BLIP-2의 38.1 ± 1.0(+29%)과 OpenFlamingo의 19.1 ± 0.4(+48%)를 상회하고, 복잡한 추론에서 81.7을 기록합니다.
- ScienceQA: LLaVA 단독으로 **90.92%**의 정확도를 달성합니다(당시 SoTA인 MM-CoT-Large의 91.68%에 근접); GPT-4를 판정자로 사용하여 불일치를 조정하면 새로운 SoTA인 **92.53%**를 얻습니다. 텍스트 전용 GPT-4의 2-shot 단독 성능은 82.69%입니다.
- Ablation: 1단계 없이 처음부터 훈련하면 정확도가 5.11점 하락하여 85.81%가 됩니다; 7B 모델은 89.84%를 기록하는데 13B의 90.92%와 비교됩니다; 마지막 레이어 CLIP 특징은 마지막 이전 레이어 특징보다 0.96점 낮습니다.
- 정성적으로 LLaVA는 도메인 밖 이미지(“Extreme Ironing” GPT-4 데모 등)에서도 명령을 따르는 반면, BLIP-2와 OpenFlamingo는 장면을 설명하는 데 그칩니다.
SLAM에서의 의미
LLaVA는 대화형 비전-언어 모델을 대중화했습니다: “인코더 + 투영 + LLM” 레시피는 이후 등장한 대부분의 로봇 공학 VLM과 비전-언어-행동 시스템의 기반이 됩니다(동일한 패턴을 따르는 VILA 백본을 사용하는 NaVILA와 같은 내비게이션 VLA, 그리고 LLaVA-1.5 데이터 조합으로 훈련된 Prismatic 백본을 사용하는 OpenVLA 포함). SLAM의 경우, 맵의 렌더링된 뷰에 연결된 LLaVA 스타일 VLM은 장면 이해, 객체 식별, 공간 질문 응답을 제공합니다 — 기하학적 SLAM 맵에서 오픈 어휘 의미론적 추론으로 가는 가장 직접적인 통합 경로 중 하나입니다.