In diesem Papier entwerfen wir zwei von nichtlinearen dynamischen Systemen inspirierte Diskriminatoren – den Multi-Scale Recurrence Discriminator (MSRD) und den Multi-Resolution Lyapunov Discriminator (MRLD) – um das inhärente deterministische Chaos der Sprache explizit zu modellieren. MSRD ist basierend auf Wiederholungsdarstellungen konzipiert, um selbstähnliche Dynamiken zu erfassen. MRLD ist basierend auf Lyapunov-Exponenten konzipiert, um nichtlineare Fluktuationen und Sensitivität gegenüber Anfangsbedingungen zu erfassen. Durch umfangreiche Designoptimierung und die Verwendung von tiefen separierbaren Faltungen in den Diskriminatoren übertrifft unser Rahmen das vorherige AP-BWE-Modell mit einer 44-fachen Reduktion der Diskriminator-Parameteranzahl (22M vs 0,48M). Soweit uns bekannt ist, zeigt dieses Papier erstmals, wie die BWE durch die subtilen nichtlinearen chaotischen Physiken der vokalen Schallproduktion beaufsichtigt werden kann, um eine signifikante Reduktion der Diskriminatorgröße zu erreichen.
Tamiti et al. (Mittwoch) haben diese Frage untersucht.