Key points are not available for this paper at this time.
Este artigo propõe uma abordagem de aprendizado auto-supervisionado para características de vídeo que resulta em desempenho significativamente melhorado em tarefas subsequentes (como classificação de vídeo, legendagem e segmentação) em comparação com métodos existentes. Nosso método estende o modelo BERT para sequências de texto para o caso de sequências de vetores de características de valores reais, substituindo a perda softmax pela estimativa de contraste de ruído (NCE). Também mostramos como aprender representações a partir de sequências de características visuais e sequências de palavras derivadas de ASR (reconhecimento automático de fala), e mostramos que esse treinamento cross-modal (quando possível) ajuda ainda mais.
Sun et al. (Qui,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: