Key points are not available for this paper at this time.
Embora a ideia geral da aprendizagem auto-supervisionada seja idêntica entre as modalidades, os algoritmos e objetivos reais diferem amplamente porque foram desenvolvidos com uma única modalidade em mente. Para nos aproximarmos da aprendizagem auto-supervisionada geral, apresentamos o data2vec, uma estrutura que utiliza o mesmo método de aprendizagem para fala, PNL ou visão computacional. A ideia central é prever representações latentes dos dados de entrada completos com base em uma visão mascarada da entrada em uma configuração de auto-diluição usando uma arquitetura padrão de Transformer. Em vez de prever alvos específicos da modalidade, como palavras, tokens visuais ou unidades de fala humana que são locais por natureza, o data2vec prediz representações latentes contextualizadas que contêm informações de toda a entrada. Experimentações nos principais benchmarks de reconhecimento de fala, classificação de imagens e compreensão da linguagem natural demonstram um novo estado da arte ou desempenho competitivo em relação às abordagens predominantes.
Baevski et al. (Mon,) estudaram essa questão.