Key points are not available for this paper at this time.
Bien que l'entraînement décentralisé soit attrayant dans l'apprentissage par renforcement multi-agent (MARL) pour sa portée et sa robustesse excellentes, ses défis de coordination inhérents dans les tâches collaboratives entraînent de nombreuses interactions pour que les agents apprennent de bonnes politiques. Pour atténuer ce problème, les méthodes de conseil d'action font partager aux agents expérimentés leurs connaissances sur ce qu'il faut faire, tandis que les agents moins expérimentés suivent strictement les conseils reçus. Toutefois, cette méthode de partage et d'utilisation des connaissances peut entraver l'exploration par l'équipe de meilleurs états, car les agents peuvent être indûment influencés par des conseils sous-optimaux ou même néfastes, en particulier dans les premières étapes de l'apprentissage. S'inspirant du fait que les humains peuvent apprendre non seulement du succès mais aussi de l'échec des autres, cet article propose un nouveau cadre de partage de connaissances appelé Partage de Connaissances Prudent-Optimiste (CONS). CONS permet à chaque agent de partager des connaissances positives et négatives et d'assimiler prudemment les connaissances des autres, renforçant ainsi l'efficacité de l'exploration en phase initiale et la robustesse des agents face à des conseils défavorables. De plus, compte tenu de l'amélioration continue des politiques, les agents valorisent davantage les connaissances négatives au début de l'apprentissage et déplacent leur attention vers les connaissances positives dans les étapes ultérieures. Notre cadre peut être facilement intégré dans des méthodes basées sur Q-learning sans introduire de coûts d'entraînement supplémentaires. Nous évaluons CONS dans plusieurs tâches multi-agents difficiles et constatons qu'il excelle dans les environnements où des modèles comportementaux optimaux sont difficiles à découvrir, surpassant les lignes de base en termes de taux de convergence et de performance finale.
Ba et al. (Sun,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: