Aktuelle auf Deep Learning basierende Sprachverbesserungsalgorithmen haben viele Anwendungen im Bereich der Geräuschreduzierung, Entschallung, Bandbreitenerweiterung und Echoabsorption, um nur einige zu nennen. Paketverlust ist ebenfalls eine der Hauptursachen für die Verschlechterung der Sprachqualität bei VoIP-Anrufen. Derzeit haben generative gegnerische Netzwerke (GANs) eine starke Fähigkeit zur Bildgenerierung gezeigt, und viele dieser Modelle funktionieren auch gut in Sprachaufgaben. In dieser Arbeit schlagen wir ein leichtgewichtiges Modell basierend auf GAN vor, um die Aufgabe der Maskierung von Audio-Paketverlusten zu bewältigen. Speziell verwenden wir ein U-förmiges Netzwerk, das im Zeit-Frequenz-Bereich als Generator fungiert, das von einem Mel-GAN-Diskriminator mit Mehrfachverlust trainiert wird. Darüber hinaus führen wir Rauschen und Bandbreitenverluste in den Trainingsdaten ein, um ungünstige Bedingungen zu simulieren. Die Experimente zeigen, dass unsere Methode die Basislinie sowohl in objektiven als auch in subjektiven Metriken unter einem idealen Kanal ohne andere Verzerrungen übertrifft und ihre Leistung auch in Anwesenheit von Rauschen und Bandbreitenverlusten weitgehend aufrechterhält.
Yang et al. (Mi,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: