Key points are not available for this paper at this time.
O aprendizado profundo trouxe melhorias significativas para o campo do aprendizado de representação cruzada. Para tarefas como texto-para-fala (TTS), conversão de voz (VC) e reconhecimento automático de fala (ASR), deseja-se uma representação de sequência fina e cruzada (nível de quadro), enfatizando o conteúdo semântico da modalidade de texto enquanto subestima a informação paralinguística da modalidade de fala. Propomos um método chamado "Pré-treinamento Acústico de Token Contrastivo Quantizado por Vetor (VQ-CTAP)", que usa o transcodificador de sequência alinhada cruzada para trazer texto e fala para um espaço multimodal conjunto, aprendendo como conectar texto e fala no nível de quadro. O VQ-CTAP proposto é um paradigma para o aprendizado de representação de sequência cruzada, oferecendo uma solução promissora para tarefas de geração e reconhecimento detalhadas no processamento de fala. O VQ-CTAP pode ser aplicado diretamente a tarefas de VC e ASR sem ajuste fino ou estruturas adicionais. Propomos um conector semântico consciente de sequência, que conecta vários módulos congelados pré-treinados para a tarefa de TTS, exibindo uma capacidade de plug-and-play. Projetamos uma estratégia de otimização gradual para garantir a convergência efetiva do modelo, injetando e ajustando gradualmente a influência de vários componentes de perda. Além disso, propomos uma perda de consistência paralinguística visando transferência semântica para aprimorar as capacidades representacionais, permitindo que o modelo generalize melhor para dados não vistos e capture as nuances da informação paralinguística. Além disso, o VQ-CTAP alcança codificação de fala de alta compressão a uma taxa de 25Hz a partir de formas de onda de entrada de 24kHz, o que representa uma redução de 960 vezes na taxa de amostragem. A demonstração de áudio está disponível em https://qiangchunyu.github.io/VQCTAP/
Qiang et al. (Sun,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: