Key points are not available for this paper at this time.
비전-언어 사전 훈련(VLP)은 많은 비전-언어 작업의 성능을 향상시켰습니다. 그러나 대부분의 기존 사전 훈련된 모델은 이해 기반 작업이나 생성 기반 작업 중에서 한 가지에만 탁월합니다. 게다가 성능 향상은 웹에서 수집된 노이즈가 있는 이미지-텍스트 쌍의 데이터셋을 확대함으로써 크게 이루어졌는데, 이는 최적의 감독 소스가 아닙니다. 이 논문에서는 비전-언어 이해 및 생성 작업 모두에 유연하게 전이할 수 있는 새로운 VLP 프레임워크인 BLIP을 제안합니다. BLIP는 캡션 생성기가 합성 캡션을 생성하고 필터가 노이즈가 있는 캡션을 제거하는 방법으로 웹 데이터를 효과적으로 활용합니다. 우리는 이미지-텍스트 검색(+2.7%의 평균 recall@1), 이미지 캡셔닝(+2.8%의 CIDEr), VQA(+1.6%의 VQA 점수)와 같은 다양한 비전-언어 작업에서 최첨단 결과를 달성했습니다. BLIP은 제로샷 방식으로 비디오-언어 작업에 직접 전이할 때도 강력한 일반화 능력을 보여줍니다. 코드, 모델 및 데이터셋은 https://github.com/salesforce/BLIP에서 공개됩니다.
Li et al. (2022)는 이 문제를 연구했습니다.