초록 배경: 컴퓨터 비전에서 다중 작업 학습은 다양한 작업을 효과적으로 처리하기 위해 표현의 공통점을 활용하는 것을 목표로 합니다. 본 논문은 분류, 분할, 이미지 캡션 생성 및 그라운딩을 동시에 수행할 수 있는 보편적 언어 인터페이스를 갖춘 결합된 CNN-변환기 모델인 FiT을 제안합니다. 방법: 이 설계는 다중 스케일 특징 추출을 위한 ResNet-50 백본과 특징 피라미드 네트워크를 활용하고, 작업 상호작용을 위한 크로스 작업 주의 메커니즘 및 언어 기반 출력을 위한 LSTM 디코더를 포함합니다. 모든 작업에 대한 균형 잡힌 학습을 보장하기 위해 동적 손실 가중치를 가진 점진적 훈련 전략이 구현되었습니다. 결과: FiT은 CIFAR-10에서 98.0% 정확도를 기록하였고, PASCAL VOC-2012에서 85.0% mIoU, Flickr30k에서 82.0% BLEU-4, COCO-2017 그라운딩에서 89.0% IoU@0.5를 달성하였습니다. 또한, 모델은 매개변수 수를 65% 최적화하고 추론 FLOPs를 4배 줄였으며, 여전히 기준 모델의 성능을 달성하거나 초월하였습니다. 결론: FiT은 다양한 작업을 통한 효율성, 확장성 및 확고한 성능을 제공하는 단일 비전 언어 프레임워크에 대한 개념 증명입니다. 따라서 이 논문은 컴퓨터 비전에서 일반 목적, 자원 효율적인 다중 모달 AI를 향한 한 걸음을 나타냅니다.
Cheema 외 (목요일), 이 질문을 연구하였습니다.