Key points are not available for this paper at this time.
La génération de musique présente quelques différences notables par rapport à la génération d'images et de vidéos. Tout d'abord, la musique est un art du temps, nécessitant un modèle temporel. Deuxièmement, la musique est généralement composée de plusieurs instruments/pistes avec leurs propres dynamiques temporelles, mais collectivement, elles se déroulent de manière interdépendante au fil du temps. Enfin, les notes musicales sont souvent regroupées en accords, arpèges ou mélodies dans la musique polyphonique, et donc introduire un classement chronologique des notes n'est pas naturellement approprié. Dans cet article, nous proposons trois modèles pour la génération musicale symbolique multi-pistes dans le cadre des réseaux antagonistes génératifs (GANs). Les trois modèles, qui diffèrent par les hypothèses sous-jacentes et, en conséquence, les architectures de réseau, sont appelés le modèle de jam, le modèle de compositeur et le modèle hybride. Nous avons entraîné les modèles proposés sur un ensemble de données de plus de cent mille mesures de musique rock et les avons appliqués pour générer des partitions de piano pour cinq pistes : basse, batterie, guitare, piano et cordes. Quelques métriques objectives intra-piste et inter-piste sont également proposées pour évaluer les résultats génératifs, en plus d'une étude utilisateur subjective. Nous montrons que nos modèles peuvent générer de la musique cohérente de quatre mesures dès le départ (c'est-à-dire sans interventions humaines). Nous étendons également nos modèles à la génération musicale coopérative homme-AI : étant donné une piste spécifique composée par un humain, nous pouvons générer quatre pistes supplémentaires pour l'accompagner. Tout le code, l'ensemble de données et les échantillons audio rendus sont disponibles sur https://salu133445.github.io/musegan/.
Dong et al. (Mer,) ont étudié cette question.