Key points are not available for this paper at this time.
시각 언어 기초는 현대 신경 이미지 캡셔닝 시스템에서 널리 연구되고 있으며, 이는 일반적으로 이미지 특징 추출을 위한 합성곱 신경망(CNN)과 언어 캡션 생성을 위한 순환 신경망(RNN)이라는 두 가지 주요 요소로 구성된 인코더-디코더 프레임워크를 채택합니다. 기계 비전과 인식에서 대립적 방해에 대한 언어 기초의 강인성을 연구하기 위해, 우리는 신경 이미지 캡셔닝에서 대립적 예제를 생성하기 위한 새로운 알고리즘인 Show-and-Fool을 제안합니다. 제안된 알고리즘은 신경 이미지 캡셔닝 시스템이 임의로 선택된 캡션이나 키워드를 출력하도록 속일 수 있는지 확인하는 두 가지 평가 방법을 제공합니다. 우리의 광범위한 실험은 우리의 알고리즘이 무작위로 표적화된 캡션이나 키워드와 시각적으로 유사한 대립적 예제를 성공적으로 생성할 수 있음을 보여주며, 이러한 대립적 예제는 다른 이미지 캡셔닝 시스템으로 고도로 전이 가능하게 만들 수 있습니다. 결과적으로, 우리의 접근 방식은 신경 이미지 캡셔닝의 새로운 강인성 함의와 시각 언어 기초에 대한 새로운 통찰력을 제공합니다.
Chen et al. (Mon,) 이 질문을 연구했습니다.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: