Key points are not available for this paper at this time.
자기 지도 학습의 일반적인 아이디어는 모드 간에 동일하지만, 실제 알고리즘과 목표는 단일 모드를 염두에 두고 개발되었기 때문에 널리 다릅니다. 일반 자기 지도 학습에 더 가까워지기 위해, 우리는 음성, 자연어 처리(NLP) 또는 컴퓨터 비전을 위해 동일한 학습 방법을 사용하는 프레임워크인 data2vec을 제시합니다. 핵심 아이디어는 표준 Transformer 아키텍처를 사용하여 자기 증류 설정에서 입력의 마스크된 뷰를 기반으로 전체 입력 데이터의 잠재 표현을 예측하는 것입니다. 단어, 시각 토큰 또는 인간 음성의 단위와 같이 지역적 성격을 가진 모드 특정 목표를 예측하는 대신, data2vec은 전체 입력의 정보를 포함하는 맥락화된 잠재 표현을 예측합니다. 음성 인식, 이미지 분류 및 자연어 이해의 주요 벤치마크에 대한 실험은 지배적인 접근 방식에 비해 새로운 최첨단 또는 경쟁 성능을 보여줍니다.
Baevski 외 (Mon,)는 이 질문을 연구했습니다.