LLaVA

Liu 2023 · 논문

한 줄 요약 — LLaVA(Large Language and Vision Assistant)는 동결된 CLIP 비전 인코더를 단일 선형 투영을 통해 Vicuna LLM에 연결하고 GPT-4가 생성한 시각적 명령 데이터로 명령 튜닝을 수행하여, 강력한 오픈소스 대화형 VLM의 핵심이 아키텍처의 복잡성이 아니라 데이터의 품질임을 보여줍니다.

문제

기계 생성 명령 따르기 데이터로 LLM을 명령 튜닝하는 것은 새로운 언어 작업에 대한 제로샷 능력을 극적으로 향상시켰지만, 이 아이디어는 다중 모달 분야에서는 거의 탐구되지 않았습니다. 당시의 VLM들은 막대한 컴퓨팅을 요구했거나(Flamingo), 복잡한 연결 아키텍처를 사용했거나(BLIP-2의 Q-Former, Flamingo의 게이트형 교차 어텐션), 비공개였습니다(GPT-4V) — 그리고 대규모로 다중 모달 대화 데이터를 수동으로 레이블링하는 것은 비용이 많이 들고 잘 정의되지 않습니다. LLaVA는 최소한의 아키텍처와 기계 생성 다중 모달 명령 데이터의 조합이 경쟁력 있고 재현 가능한 오픈 VLM을 만들어낼 수 있는지를 묻습니다.

방법 및 아키텍처

Hv=WZv,여기서 Zv=g(Xv)\mathbf{H}_v = \mathbf{W} \cdot \mathbf{Z}_v, \quad \text{여기서 } \mathbf{Z}_v = g(\mathbf{X}_v)

시각 토큰 Hv\mathbf{H}_v는 단순히 LLM의 맥락에 텍스트와 함께 배치됩니다 — Q-Former나 교차 어텐션 모듈이 없습니다.

p(XaXv,Xinstruct)=i=1Lpθ(xiXv,Xinstruct,<i,Xa,<i)p(\mathbf{X}_a \mid \mathbf{X}_v, \mathbf{X}_{\text{instruct}}) = \prod_{i=1}^{L} p_{\boldsymbol{\theta}}\big(x_i \mid \mathbf{X}_v, \mathbf{X}_{\text{instruct},<i}, \mathbf{X}_{a,<i}\big)

여기서 Xinstruct,<i\mathbf{X}_{\text{instruct},<i}Xa,<i\mathbf{X}_{a,<i}는 현재 예측 토큰 xix_i 이전의 명령 토큰과 답변 토큰입니다.

실험 결과

SLAM에서의 의미

LLaVA는 대화형 비전-언어 모델을 대중화했습니다: “인코더 + 투영 + LLM” 레시피는 이후 등장한 대부분의 로봇 공학 VLM과 비전-언어-행동 시스템의 기반이 됩니다(동일한 패턴을 따르는 VILA 백본을 사용하는 NaVILA와 같은 내비게이션 VLA, 그리고 LLaVA-1.5 데이터 조합으로 훈련된 Prismatic 백본을 사용하는 OpenVLA 포함). SLAM의 경우, 맵의 렌더링된 뷰에 연결된 LLaVA 스타일 VLM은 장면 이해, 객체 식별, 공간 질문 응답을 제공합니다 — 기하학적 SLAM 맵에서 오픈 어휘 의미론적 추론으로 가는 가장 직접적인 통합 경로 중 하나입니다.

관련 문서