LLaVA

Liu 2023 · 论文

一句话总结 — LLaVA(Large Language and Vision Assistant)通过一个单一的线性投影将冻结的 CLIP 视觉编码器与 Vicuna LLM 连接起来,并在 GPT-4 生成的视觉指令数据上进行指令微调,表明数据质量——而非架构复杂度——才是打造强大开源对话式 VLM 的关键。

问题

在机器生成的指令跟随数据上对 LLM 进行指令微调,已经显著提升了模型在新语言任务上的零样本能力,但这一思路在多模态领域基本上仍未被探索。当时的 VLM 要么需要巨大的计算量(Flamingo),要么使用复杂的桥接架构(BLIP-2 的 Q-Former、Flamingo 的门控交叉注意力),要么是闭源的(GPT-4V)——而人工大规模标注多模态对话数据既昂贵又界定不清。LLaVA 探究的问题是:一个极简架构加上机器生成的多模态指令数据,能否得到一个有竞争力、可复现的开源 VLM。

方法与架构

Hv=WZv,其中 Zv=g(Xv)\mathbf{H}_v = \mathbf{W} \cdot \mathbf{Z}_v, \quad \text{其中 } \mathbf{Z}_v = g(\mathbf{X}_v)

视觉词元 Hv\mathbf{H}_v 直接与文本一起被放入 LLM 的上下文中——没有 Q-Former,没有交叉注意力模块。

p(XaXv,Xinstruct)=i=1Lpθ(xiXv,Xinstruct,<i,Xa,<i)p(\mathbf{X}_a \mid \mathbf{X}_v, \mathbf{X}_{\text{instruct}}) = \prod_{i=1}^{L} p_{\boldsymbol{\theta}}\big(x_i \mid \mathbf{X}_v, \mathbf{X}_{\text{instruct},<i}, \mathbf{X}_{a,<i}\big)

其中 Xinstruct,<i\mathbf{X}_{\text{instruct},<i}Xa,<i\mathbf{X}_{a,<i} 分别是当前预测词元 xix_i 之前的指令词元和回答词元。

实验结果

对SLAM的意义

LLaVA 使对话式视觉语言模型走向大众化:“编码器 + 投影 + LLM”这一配方成为随后大多数机器人 VLM 和视觉-语言-动作系统的基础(包括导航类 VLA,如 NaVILA,其 VILA 骨干网络遵循相同模式,以及 OpenVLA 的 Prismatic 骨干网络,其在 LLaVA-1.5 数据混合集上训练)。对于 SLAM 而言,将 LLaVA 风格的 VLM 接入地图的渲染视图,可以提供场景理解、物体识别和空间问答能力——这是从几何 SLAM 地图通往开放词汇语义推理最直接的集成路径之一。

相关条目