Key points are not available for this paper at this time.
자연어 생성(NLG)은 이미지, 비디오 또는 텍스트 형태의 입력 데이터를 받아들이고, 해당하는 자연어 텍스트를 출력으로 생성합니다. 기존 NLG 방법은 주로 감독 학습 방식에 의존하며, 데이터-텍스트 쌍에 강하게 의존합니다. 그러나 많은 특정 시나리오와 비영어권 언어의 경우, 충분한 양의 레이블이 있는 데이터가 종종 제공되지 않습니다. 그 결과, 학습을 위한 데이터-텍스트 쌍을 수집하고 레이블을 다는 것이 필요하며, 이는 비용과 시간이 많이 소모됩니다. 하위 작업의 레이블이 있는 데이터에 대한 의존도를 완화하기 위해, 우리는 여러 NLG 작업을 처리할 수 있는 직관적이고 효과적인 제로샷 학습 프레임워크인 ZeroNLG를 제안합니다. 이 프레임워크는 이미지-텍스트(이미지 캡셔닝), 비디오-텍스트(비디오 캡셔닝), 텍스트-텍스트(신경 기계 번역) 등의 작업을 영어, 중국어, 독일어 및 프랑스어를 포함한 통합된 프레임워크 내에서 처리할 수 있습니다. ZeroNLG는 학습을 위해 레이블이 있는 하위 쌍을 요구하지 않습니다. 학습 중, ZeroNLG는 (i) 서로 다른 도메인(모달리티 및 언어를 가로질러)을 공유된 공통 잠재 공간의 해당 좌표에 투영하고; (ii) 이 공간에서 해당 좌표를 정렬하여 서로 다른 도메인을 연결하고; (iii) 입력 텍스트의 좌표를 바탕으로 텍스트를 생성하는 방법을 배우기 위해 비지도 다국어 자동 인코더를 구축합니다. 따라서 추론 중, 데이터-텍스트 파이프라인을 기반으로, ZeroNLG는 공통 공간에서 입력 데이터의 좌표에 따라 다른 언어로 목표 문장을 생성할 수 있습니다. 이 통합된 프레임워크 내에서 시각적(영상 또는 비디오) 데이터를 입력으로 받을 때, ZeroNLG는 제로샷 시각적 캡셔닝을 수행할 수 있으며; 텍스트 문장을 입력으로 받을 때, ZeroNLG는 제로샷 기계 번역을 수행할 수 있습니다. 우리는 12개의 NLG 작업에 대한 광범위한 실험 결과를 제시하며, 레이블이 있는 하위 쌍을 사용하지 않고도 ZeroNLG가 높은 품질의 "신뢰할 수 있는" 출력을 생성하고, 기존의 제로샷 방법들을 크게 능가함을 보여줍니다. 우리의 코드와 데이터는 https://github.com/yangbang18/ZeroNLG 에서 확인할 수 있습니다.
Yang et al. (Thu,)는 이 질문을 연구했습니다.