SigLIP
Zhai (Google) 2023 · 논문
한 줄 요약 — SigLIP은 CLIP의 소프트맥스 대조 손실을 배치 전체를 볼 필요가 없는 단순한 쌍별 시그모이드 손실로 교체하여, 언어-이미지 사전 훈련이 거대한 배치로 확장되고 소규모 배치에서 더 잘 동작하며, 단 네 개의 TPUv4 칩만으로 ImageNet 제로샷 84.5%를 달성하게 합니다.
문제
표준 대조적 언어-이미지 사전 훈련(CLIP/ALIGN)은 유사도 점수를 배치 수준 소프트맥스로 정규화하며, 이를 두 번(이미지 축과 텍스트 축) 적용합니다. 이는 모든 쌍별 유사도에 대한 전역적 관점을 요구합니다: 비용이 큰 all-gather 연산, 유사도 행렬의 구체화, 그리고 배치 전체에 대한 추가 안정화 과정(최댓값 감산)까지 필요합니다 — 이는 손실의 품질을 배치 크기에 결합시켜, 데이터센터 규모 클러스터 없이는 CLIP급 사전 훈련에 도달할 수 없게 만듭니다. SigLIP은 이러한 전역 정규화가 정말로 필요한지를 묻습니다.
방법 및 아키텍처
소프트맥스 기준선(대체 대상). 정규화된 임베딩 , 와 학습된 온도 가 주어지면, CLIP은 다음을 최소화합니다.
시그모이드 손실. SigLIP은 모든 조합에 대해 각 이미지-텍스트 쌍을 독립적으로 이진 분류 — 매칭인지 아닌지 — 로 취급합니다. 여기서 레이블 는 가 매칭되면 , 아니면 이고, 는 학습된 온도, 는 학습된 편향입니다. 배치의 나머지에 대한 정규화가 전혀 필요하지 않습니다.
편향 초기화. 개의 긍정 쌍에 대해 개의 부정 쌍이 존재하므로, 다스려지지 않은 손실은 초기에 부정 쌍에 압도되어 거대한 교정 스텝을 유발합니다. , 으로 초기화하면 훈련이 “무작위 쌍은 매칭되지 않는다”는 사전 확률 근처에서 시작됩니다.
청크 단위 분산 구현. 개 장치에 걸친 데이터 병렬화와 장치당 배치 에서, 손실은 블록 단위로 계산됩니다: 각 장치가 자신의 로컬 블록을 채점하고, 텍스트 표현이 장치 간에 순환되어 부정 예제가 돌아가면서 등장하며, 장치별 손실을 합산합니다. all-gather가 전혀 없고, 오직 행렬만 구체화됩니다 — 시그모이드 손실은 대칭적이어서 단 한 번의 패스만 필요합니다.
두 가지 레시피. SigLIP은 WebLI에서 두 타워(ViT 이미지 인코더 + Transformer 텍스트 인코더로, CLIP과 동일)를 모두 훈련합니다; SigLiT은 Locked-image Tuning을 따라, 동결된 사전 훈련 이미지 인코더에 대해 텍스트 타워만 훈련합니다. 손실을 배치 크기에서 분리한 덕분에 예제-대-쌍의 트레이드오프 연구와 극단적 배치 크기에서의 훈련도 가능해집니다.
실험 결과
- SigLiT은 동결된 공개 B/8 체크포인트로 LiT 데이터셋에서 네 개의 TPUv4 칩으로 하루 훈련하여 ImageNet 제로샷 **79.7%**에 도달하며, g/14 체크포인트로는 이틀 만에 **84.5%**에 도달합니다.
- SigLIP B/16은 WebLI에서 16개의 TPUv4 칩으로 사흘 훈련하여 ImageNet 제로샷 **71.0%**에 도달합니다; 배치 32k에서 2일 훈련 시 72.1%, 32개 칩으로 5일 훈련 시 73.4%입니다.
- 배치 크기를 512에서 100만까지 훑어본 결과: 시그모이드 손실은 배치 16k 미만에서 소프트맥스를 큰 격차로 능가합니다; 배치가 커질수록 격차는 좁혀지고 두 손실 모두 성능이 포화됩니다 — 배치 크기 32k면 충분하다는 결론이며, 이는 100개 이상 언어로 훈련된 다국어 mSigLIP에서도(XM3600 검색으로 평가) 유지됩니다.
- 시그모이드 손실은 소프트맥스보다 메모리 효율이 높으며, 이것이 100만 배치 실험과 소규모 칩 훈련을 가능하게 한 요인입니다; 모델은
big_vision에 공개되었습니다.
SLAM에서의 의미
SigLIP은 멀티모달 스택에서 기본 CLIP 대체물이 되었습니다: OpenVLA와 2024년 이후 대부분의 VLM 내부에서 (흔히 DINOv2와 짝을 이루는) 비전 인코더 역할을 하므로, 그 텍스트 정렬 특징이 오늘날 대부분의 로봇 인식 시스템이 실제로 “보는” 것입니다. SLAM 입장에서 SigLIP 특징은 오픈 어휘 매핑에서 CLIP 특징이 하던 것과 같은 역할 — 언어로 쿼리 가능한 의미를 3D 맵에 임베딩하는 것 — 을 계산량 대비 더 나은 정확도로 수행하며, 이는 온보드 로봇 배포에서 중요한 이점입니다.