Key points are not available for this paper at this time.
Apresentamos o SpecAugment, um método simples de aumento de dados para reconhecimento de fala. O SpecAugment é aplicado diretamente às entradas de características de uma rede neural (ou seja, coeficientes de filtro). A política de aumento consiste em deformar as características, mascarar blocos de canais de frequência e mascarar blocos de passos de tempo. Aplicamos o SpecAugment em redes Listen, Attend e Spell para tarefas de reconhecimento de fala de ponta a ponta. Alcançamos um desempenho de estado da arte nas tarefas LibriSpeech 960h e Switchboard 300h, superando todos os trabalhos anteriores. No LibriSpeech, conseguimos 6,8% de WER no teste-outro sem o uso de um modelo de linguagem e 5,8% de WER com fusão rasa com um modelo de linguagem. Isso se compara ao sistema híbrido anterior de estado da arte de 7,5% de WER. Para o Switchboard, conseguimos 7,2%/14,6% na parte Switchboard/CallHome do conjunto de testes Hub5'00 sem o uso de um modelo de linguagem e 6,8%/14,1% com fusão rasa, o que se compara ao sistema híbrido anterior de estado da arte em 8,3%/17,3% de WER.
Park et al. (Sex,) estudaram essa questão.