L'amélioration de la parole zéro-shot (SE) vise à améliorer la qualité de la parole dans des conditions acoustiques non vues sans nécessiter un ajustement spécifique à la tâche. Ce travail propose une modélisation du bruit étendue pour l'amélioration de la parole zéro-shot évolutive et adaptative (EN-AZS), un cadre SE zéro-shot avec une modélisation du bruit étendue, construit sur une architecture basée sur Undiff optimisée. En étendant le modèle de bruit pour couvrir une plus large gamme de variabilité acoustique et en incorporant des mécanismes tels que l'évaluation de la qualité de la parole et le calcul des coefficients avec des stratégies de mise à jour contrôlées, EN-AZS améliore efficacement la clarté de la parole tout en évitant le surajustement aux mélanges observés. D'importantes expériences sur les ensembles de données TIMIT-N6/N9/N15, VCTK-DM et MUSAN démontrent qu'EN-AZS surpasse constamment les méthodes de base supervisées et non supervisées, particulièrement sous des types de bruit mal assortis, des caractéristiques de parole et des conditions SNR. Des études d'ablation valident également l'importance des mécanismes d'orientation de la qualité de la parole et du calcul des coefficients et des stratégies de mise à jour. EN-AZS fournit une solution évolutive, prête à l'emploi pour une SE zéro-shot robuste, offrant une approche prometteuse pour des applications réelles avec des conditions de bruit diversifiées et imprévisibles.
Chu et al. (Jeu,) ont étudié cette question.