Key points are not available for this paper at this time.
Modellbasiertes Reinforcement Learning (RL) Methoden versuchen, ein Dynamikmodell zu lernen, um die reale Umgebung zu simulieren und dieses Modell zu nutzen, um bessere Entscheidungen zu treffen. Das erlernte Umweltsimulationsmodell weist jedoch oft mehr oder weniger Modellfehler auf, was die Entscheidungsfindung stören und die Leistung reduzieren könnte. Wir schlagen eine bootstrapped modellbasierte RL-Methode vor, die die Module in jeder Tiefe des Planungsbaums bootstrapped. Diese Methode kann die Unsicherheit des Umweltmodells für verschiedene Zustand-Aktions-Paare quantifizieren und den Agenten dazu führen, die Paare mit höherer Unsicherheit zu erkunden, um potenzielle Modellfehler zu reduzieren. Darüber hinaus entnehmen wir Zielwerte aus ihrer Bootstrap-Verteilung, um die Unsicherheiten an aktuellen und nachfolgenden Zeitpunkten zu verknüpfen und führen den Vormechanismus ein, um die Explorationseffizienz zu verbessern. Experimentelle Ergebnisse zeigen, dass unsere Methode den Modellfehler effizient verringert und TreeQN sowie andere hochmoderne Methoden in mehreren Atari-Spielen übertrifft.
Huang et al. (Wed,) untersuchten diese Frage.
Synapse has enriched one closely related paper. Consider it for comparative context: