Key points are not available for this paper at this time.
Cet article aborde le problème de l'apprentissage d'un équilibre de Nash dans des jeux de Markov multijoueurs à somme générale avec un coefficient de discount γ. Un élément clé de ce modèle est la possibilité pour les joueurs de collaborer ou de s'opposer pour augmenter leurs récompenses. Construire un joueur artificiel pour les jeux de Markov à somme générale implique d'apprendre des stratégies plus complexes qui sont impossibles à obtenir en utilisant des techniques développées pour des jeux de Markov à somme nulle à deux joueurs. Dans cet article, nous introduisons une nouvelle définition de l'équilibre ε de Nash dans les jeux de Markov qui saisit la qualité des stratégies pour les jeux multijoueurs. Nous prouvons que minimiser la norme de deux résidus de type Bellman implique la convergence vers un tel équilibre ε de Nash. Ensuite, nous montrons que minimiser une estimation empirique de la norme Lₚ de ces résidus de type Bellman permet d'apprendre pour les jeux à somme générale dans le cadre par lot. Enfin, nous introduisons une architecture de réseau de neurones nommée NashNetwork qui apprend avec succès un équilibre de Nash dans un jeu de Markov multijoueur à somme générale basé sur des tours.
Pérolat et al. (Mar), ont étudié cette question.