SigLIP

Zhai (Google) 2023 · 논문

한 줄 요약 — SigLIP은 CLIP의 소프트맥스 대조 손실을 배치 전체를 볼 필요가 없는 단순한 쌍별 시그모이드 손실로 교체하여, 언어-이미지 사전 훈련이 거대한 배치로 확장되고 소규모 배치에서 더 잘 동작하며, 단 네 개의 TPUv4 칩만으로 ImageNet 제로샷 84.5%를 달성하게 합니다.

문제

표준 대조적 언어-이미지 사전 훈련(CLIP/ALIGN)은 유사도 점수를 배치 수준 소프트맥스로 정규화하며, 이를 두 번(이미지 축과 텍스트 축) 적용합니다. 이는 모든 쌍별 유사도에 대한 전역적 관점을 요구합니다: 비용이 큰 all-gather 연산, B×B|\mathcal{B}| \times |\mathcal{B}| 유사도 행렬의 구체화, 그리고 배치 전체에 대한 추가 안정화 과정(최댓값 감산)까지 필요합니다 — 이는 손실의 품질을 배치 크기에 결합시켜, 데이터센터 규모 클러스터 없이는 CLIP급 사전 훈련에 도달할 수 없게 만듭니다. SigLIP은 이러한 전역 정규화가 정말로 필요한지를 묻습니다.

방법 및 아키텍처

소프트맥스 기준선(대체 대상). 정규화된 임베딩 xi=f(Ii)/f(Ii)2x_i = f(I_i)/\|f(I_i)\|_2, yi=g(Ti)/g(Ti)2y_i = g(T_i)/\|g(T_i)\|_2와 학습된 온도 tt가 주어지면, CLIP은 다음을 최소화합니다. 12Bi=1B(logetxiyijetxiyj+logetxiyijetxjyi).-\frac{1}{2|\mathcal{B}|} \sum_{i=1}^{|\mathcal{B}|} \left( \log \frac{e^{t\, x_i \cdot y_i}}{\sum_{j} e^{t\, x_i \cdot y_j}} + \log \frac{e^{t\, x_i \cdot y_i}}{\sum_{j} e^{t\, x_j \cdot y_i}} \right).

시그모이드 손실. SigLIP은 모든 B2|\mathcal{B}|^2 조합에 대해 각 이미지-텍스트 쌍을 독립적으로 이진 분류 — 매칭인지 아닌지 — 로 취급합니다. L=1Bi=1Bj=1Blog11+ezij(txiyj+b)\mathcal{L} = -\frac{1}{|\mathcal{B}|} \sum_{i=1}^{|\mathcal{B}|} \sum_{j=1}^{|\mathcal{B}|} \log \frac{1}{1 + e^{z_{ij}\,(-t\, x_i \cdot y_j + b)}} 여기서 레이블 zijz_{ij}(Ii,Tj)(I_i, T_j)가 매칭되면 11, 아니면 1-1이고, t=exp(t)t = \exp(t')는 학습된 온도, bb는 학습된 편향입니다. 배치의 나머지에 대한 정규화가 전혀 필요하지 않습니다.

편향 초기화. B|\mathcal{B}|개의 긍정 쌍에 대해 B2B|\mathcal{B}|^2 - |\mathcal{B}|개의 부정 쌍이 존재하므로, 다스려지지 않은 손실은 초기에 부정 쌍에 압도되어 거대한 교정 스텝을 유발합니다. t=log10t' = \log 10, b=10b = -10으로 초기화하면 훈련이 “무작위 쌍은 매칭되지 않는다”는 사전 확률 근처에서 시작됩니다.

청크 단위 분산 구현. DD개 장치에 걸친 데이터 병렬화와 장치당 배치 b=B/Db = |\mathcal{B}|/D에서, 손실은 블록 단위로 계산됩니다: 각 장치가 자신의 로컬 b×bb \times b 블록을 채점하고, 텍스트 표현이 장치 간에 순환되어 부정 예제가 돌아가면서 등장하며, 장치별 손실을 합산합니다. all-gather가 전혀 없고, 오직 b×bb \times b 행렬만 구체화됩니다 — 시그모이드 손실은 대칭적이어서 단 한 번의 패스만 필요합니다.

두 가지 레시피. SigLIP은 WebLI에서 두 타워(ViT 이미지 인코더 + Transformer 텍스트 인코더로, CLIP과 동일)를 모두 훈련합니다; SigLiT은 Locked-image Tuning을 따라, 동결된 사전 훈련 이미지 인코더에 대해 텍스트 타워만 훈련합니다. 손실을 배치 크기에서 분리한 덕분에 예제-대-쌍의 트레이드오프 연구와 극단적 배치 크기에서의 훈련도 가능해집니다.

실험 결과

SLAM에서의 의미

SigLIP은 멀티모달 스택에서 기본 CLIP 대체물이 되었습니다: OpenVLA와 2024년 이후 대부분의 VLM 내부에서 (흔히 DINOv2와 짝을 이루는) 비전 인코더 역할을 하므로, 그 텍스트 정렬 특징이 오늘날 대부분의 로봇 인식 시스템이 실제로 “보는” 것입니다. SLAM 입장에서 SigLIP 특징은 오픈 어휘 매핑에서 CLIP 특징이 하던 것과 같은 역할 — 언어로 쿼리 가능한 의미를 3D 맵에 임베딩하는 것 — 을 계산량 대비 더 나은 정확도로 수행하며, 이는 온보드 로봇 배포에서 중요한 이점입니다.

관련 문서