Key points are not available for this paper at this time.
Nous considérons le problème de l'accès dynamique au spectre pour la maximisation de l'utilité du réseau dans les réseaux sans fil multicanaux. La bande passante partagée est divisée en K canaux orthogonaux, et les utilisateurs accèdent au spectre à l'aide d'un protocole d'accès aléatoire. Au début de chaque créneau horaire, chaque utilisateur sélectionne un canal et transmet un paquet avec une certaine probabilité de tentative. Après chaque créneau horaire, chaque utilisateur ayant transmis un paquet reçoit une observation locale indiquant si son paquet a été livré avec succès ou non (c'est-à-dire un signal ACK). L'objectif est de trouver une stratégie multi-utilisateur qui maximise une certaine utilité du réseau de manière distribuée, sans coordination en ligne ni échanges de messages entre les utilisateurs. Obtenir une solution optimale pour le problème d'accès au spectre est généralement coûteux en termes de calcul en raison de l'espace d'état large et de l'observabilité partielle des états. Pour résoudre ce problème, nous développons un algorithme d'accès dynamique au spectre distribué basé sur l'apprentissage par renforcement multi-utilisateur profond. Plus spécifiquement, à chaque créneau horaire, chaque utilisateur mappe son état actuel vers des actions d'accès au spectre en fonction d'un réseau deep-Q entraîné utilisé pour maximiser la fonction objectif. Les résultats expérimentaux ont démontré que les utilisateurs sont capables d'apprendre de bonnes politiques qui atteignent de fortes performances dans ce cadre partiellement observable exigeant, uniquement à partir de leurs signaux ACK, sans coordination en ligne, échanges de messages entre utilisateurs, ou détection de porteuse.
Naparstek et al. (Vendredi,) ont étudié cette question.