Key points are not available for this paper at this time.
La reconnaissance des émotions dans la parole (SER) joue un rôle important dans l'interaction vocale intelligente. Un défi majeur dans la SER est d'extraire des caractéristiques pertinentes pour les émotions à partir des signaux de parole. Dans les techniques SER de pointe, les méthodes d'apprentissage profond, par exemple, les Réseaux de Neurones Convolutionnels (CNN), sont largement utilisées pour l'apprentissage des caractéristiques et ont obtenu des performances significatives. Cependant, dans les méthodes orientées CNN, deux limitations de performance ont été soulevées : 1) la perte de la structure temporelle de la parole dans la réduction progressive de la résolution ; 2) l'ignorance des dépendances relatives entre les éléments dans la séquence de caractéristiques suprasegmentales. Dans cet article, nous proposons l'utilisation combinée d'un Réseau Résiduel Dilué (DRN) et de l'Auto-attention Multi-tête pour atténuer les limitations ci-dessus. En utilisant le DRN, le réseau peut conserver une haute résolution de la structure temporelle dans l'apprentissage des caractéristiques, avec une taille de champ réceptif similaire à l'approche basée sur le CNN. En employant l'Auto-attention Multi-tête, le réseau peut modéliser les dépendances internes entre les éléments de positions différentes dans la séquence de caractéristiques suprasegmentales apprises, ce qui améliore l'importation des informations saillantes sur les émotions. Des expériences sur l'ensemble de données de référence émotionnelle IEMOCAP ont démontré l'efficacité du cadre proposé, avec une amélioration relative de 11,7 % à 18,6 % par rapport aux approches de pointe.
Li et al. (Wed,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: