Los puntos clave no están disponibles para este artículo en este momento.
Las emociones se encuentran en un continuo, pero los modelos actuales tratan las emociones como una variable discreta de valor finito. Esta representación no captura la diversidad en la expresión de las emociones. Para representar mejor las emociones, proponemos el uso de descripciones en lenguaje natural (o indicaciones). En este trabajo, abordamos el desafío de generar automáticamente estas indicaciones y entrenar un modelo para aprender mejor las representaciones emocionales a partir de pares de audio e indicaciones. Utilizamos propiedades acústicas que están correlacionadas con la emoción, como el tono, la intensidad, la velocidad del habla y la tasa de articulación, para generar automáticamente las indicaciones, es decir, 'indicaciones acústicas'. Utilizamos un objetivo de aprendizaje contrastivo para mapear el habla a sus respectivas indicaciones acústicas. Evaluamos nuestro modelo en la recuperación de audio emocional y el reconocimiento de emociones en el habla. Nuestros resultados muestran que las indicaciones acústicas mejoran significativamente el rendimiento del modelo en EAR, en varias métricas de Precision@K. En SER, observamos una mejora de precisión relativa del 3.8% en el conjunto de datos de Ravdess.
Dhamyal et al. (Mon,) estudiaron esta cuestión.