Key points are not available for this paper at this time.
이미지의 내용을 자동으로 설명하는 것은 컴퓨터 비전과 자연어 처리를 연결하는 인공지능의 기본 문제입니다. 본 논문에서는 최근 컴퓨터 비전과 기계 번역의 발전을 결합한 심층 순환 구조 기반의 생성 모델을 제시하며, 이를 통해 이미지를 설명하는 자연스러운 문장을 생성할 수 있습니다. 이 모델은 훈련 이미지에 주어진 목표 설명 문장의 가능성을 최대화하도록 훈련됩니다. 여러 데이터셋에 대한 실험 결과는 모델의 정확성과 이미지 설명만으로 학습한 언어의 유창성을 보여줍니다. 우리의 모델은 종종 매우 정확하며, 이를 정성적 및 정량적으로 검증합니다. 예를 들어, 현재 최신 BLEU-1 점수(Pascal 데이터셋의 경우, 점수가 높을수록 좋음)는 25인데 반해, 우리의 접근법은 59를 기록하며, 인간 성능은 약 69입니다. 또한, Flickr30k에서 BLEU-1 점수가 56에서 66으로, SBU에서 19에서 28로 개선된 것을 보여줍니다. 마지막으로, 새로 출시된 COCO 데이터셋에서는 27.7의 BLEU-4를 달성하며, 이는 현재 최신 기술입니다.
Vinyals 외(2016)는 이 질문을 조사했습니다.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: