Key points are not available for this paper at this time.
우리는 이미지-텍스트 사전 훈련을 위한 간단한 쌍별 시그모이드 손실을 제안합니다. 소프트맥스 정규화로 표준 대조 학습과 달리, 시그모이드 손실은 오직 이미지-텍스트 쌍에서만 작동하며 정규화를 위해 쌍별 유사성의 전역 뷰를 필요로 하지 않습니다. 시그모이드 손실은 배치 크기를 추가로 확대하는 것을 동시에 허용하며, 작은 배치 크기에서는 더 나은 성능을 보입니다. 단 네 개의 TPUv4 칩으로, 우리는 4k 배치 크기로 기본 CLIP 모델을 훈련하고 20k 배치 크기로 대형 LiT 모델을 훈련할 수 있으며, 후자는 이틀 만에 84.5% ImageNet 제로샷 정확도를 달성합니다. 손실에서 배치 크기를 분리함으로써 예제 대 쌍 및 부정 대 긍정 비율의 영향을 연구할 수 있습니다. 마지막으로, 우리는 배치 크기를 극단적으로 확장하여 백만까지 도달하고, 배치 크기를 증가시키는 이점이 빠르게 감소한다는 것을 발견했으며, 32k라는 보다 합리적인 배치 크기가 충분합니다. 우리의 연구가 언어-이미지 사전 훈련의 품질과 효율성을 개선하기 위한 추가 탐구를 동기부여하기를 바랍니다.
Zhai et al. (Sun,)은 이 질문을 연구했습니다.