Key points are not available for this paper at this time.
Les ensembles de données existants pour la compréhension de l'audio se concentrent principalement sur des interactions à un seul tour (c'est-à-dire la légende audio, la réponse à des questions audio) pour décrire l'audio en langage naturel, limitant ainsi la compréhension de l'audio via un dialogue interactif. Pour combler cette lacune, nous introduisons Audio Dialogues : un ensemble de données de dialogues multi-tours contenant 163,8k échantillons pour des sons audio généraux et de la musique. En plus des dialogues, Audio Dialogues contient également des paires question-réponse pour comprendre et comparer plusieurs audios d'entrée ensemble. Audio Dialogues s'appuie sur une approche basée sur des invites et des annotations de légende provenant d'ensembles de données existants pour générer des dialogues multi-tours en utilisant un modèle de langage de grande taille (LLM). Nous évaluons les modèles de langage de grande taille augmentés par l'audio existants sur notre ensemble de données proposé pour démontrer la complexité et l'applicabilité d'Audio Dialogues. Notre code pour générer l'ensemble de données sera rendu public. Des invites détaillées et des dialogues générés peuvent être trouvés sur le site de démonstration https://audiodialogues.github.io/.
Goel et al. (Jeudi,) ont étudié cette question.