Key points are not available for this paper at this time.
Transformers foram estabelecidos como uma das abordagens neurais mais eficazes na realização de diversas tarefas de Processamento de Linguagem Natural. No entanto, seguindo a tendência comum em arquiteturas profundas modernas, sua escala cresceu rapidamente a um ponto que reduz a possibilidade concreta de várias empresas treinarem tais modelos do zero. De fato, apesar de seus desempenhos de alto nível, os Transformers apresentam a desvantagem geral de requerer uma enorme quantidade de dados de treinamento, recursos computacionais e consumo de energia para serem otimizados com sucesso. Por essa razão, arquiteturas mais recentes, como as Representações de Codificadores Bidirecionais a partir de Transformers, dependem de dados não rotulados para pré-treinar o modelo, que é posteriormente ajustado para uma tarefa específica usando uma quantidade relativamente menor de dados de treinamento. De maneira semelhante, este artigo considera uma estrutura plug-and-play que pode ser usada para injetar múltiplos recursos sintáticos, como Marcação de Parte do Discurso ou Análise de Dependência, em qualquer tipo de Transformer pré-treinado. Esta abordagem nova permite realizar tarefas de rotulagem sequência a sequência explorando: (i) os dados de treinamento (mais abundantes) disponíveis que também são usados para aprender os recursos sintáticos, (ii) os dados de linguagem que são usados para pré-treinar o modelo transformer. Os resultados experimentais mostram que nossa abordagem melhora o desempenho de referência do modelo subjacente em diferentes conjuntos de dados, provando assim a eficácia do emprego de informação linguística sintática para regularização semântica. Além disso, mostramos que nossa arquitetura tem uma grande vantagem de eficiência sobre modelos de linguagem grandes puros. De fato, ao usar um modelo com tamanho limitado, mas cujos dados de entrada são enriquecidos com informação sintática, mostramos que é possível obter uma redução significativa nas emissões de CO2 sem diminuir o desempenho das previsões.
Fioravanti et al. (Sun,) estudaram esta questão.