Los puntos clave no están disponibles para este artículo en este momento.
La literatura sobre la búsqueda de equilibrio en teoría de juegos se centra predominantemente en juegos individuales o en su repetición. Sin embargo, numerosos escenarios del mundo real presentan la jugabilidad de un juego muestreado de una distribución de juegos similares, pero no idénticos, como jugar al póker con diferentes cartas públicas o negociar activos correlacionados en el mercado de valores. Dado que estos juegos similares presentan equilibrios similares, investigamos una forma de acelerar la búsqueda de equilibrio en dicha distribución. Presentamos un novedoso marco de ``aprendizaje a no arrepentirse'', que nos permite aprender de manera meta un minimizador de arrepentimiento adaptado a una distribución específica. Nuestra contribución clave, Neural Predictive Regret Matching, está única y metaalentamente diseñada para converger rápidamente en la distribución elegida de juegos, mientras garantiza la minimización del arrepentimiento en cualquier juego. Validamos la convergencia más rápida de nuestros algoritmos en una distribución de juegos de póker en río. Nuestros experimentos muestran que los algoritmos metaalentados superan a sus contrapartes no metaalentadas, logrando mejoras de más de diez veces.
Sychrovský et al. (Sun,) estudiaron esta cuestión.