Key points are not available for this paper at this time.
La plupart des algorithmes d'apprentissage par renforcement profond sont peu efficaces en matière de données dans des environnements complexes et riches, limitant leur applicabilité à de nombreux scénarios. Une direction pour améliorer l'efficacité des données est l'apprentissage multitâche avec des paramètres de réseau neural partagés, où l'efficacité peut être améliorée par le transfert entre des tâches connexes. En pratique, toutefois, cela n'est généralement pas observé, car les gradients de différentes tâches peuvent interférer négativement, rendant l'apprentissage instable et parfois même moins efficace en termes de données. Un autre problème est la différence des schémas de récompense entre les tâches, ce qui peut facilement conduire à une tâche dominant l'apprentissage d'un modèle partagé. Nous proposons une nouvelle approche pour l'apprentissage conjoint de plusieurs tâches, que nous désignons sous le nom de Distral (apprentissage par distillation et transfert). Au lieu de partager des paramètres entre les différents travailleurs, nous proposons de partager une politique "distillée" qui capture un comportement commun à travers les tâches. Chaque travailleur est formé pour résoudre sa propre tâche tout en étant contraint de rester proche de la politique partagée, tandis que la politique partagée est entraînée par distillation pour être le centroïde de toutes les politiques de tâche. Les deux aspects du processus d'apprentissage sont dérivés en optimisant une fonction objective conjointe. Nous montrons que notre approche soutient un transfert efficace dans des environnements 3D complexes, surpassant plusieurs méthodes connexes. De plus, le processus d'apprentissage proposé est plus robuste et plus stable - des attributs qui sont critiques dans l'apprentissage par renforcement profond.
Teh et al. (Jeu,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: