Key points are not available for this paper at this time.
Wir schlagen einen neuartigen Trainingsalgorithmus für das Reinforcement Learning vor, der die Stärken des Deep Q-Learning mit einem Ansatz der eingeschränkten Optimierung kombiniert, um die Optimalität zu straffen und eine schnellere Belohnungspropagation zu fördern. Unsere neuartige Technik macht Deep Reinforcement Learning praktischer, indem sie die Trainingszeit drastisch reduziert. Wir bewerten die Leistung unseres Ansatzes an den 49 Spielen der herausfordernden Arcade Learning Environment und berichten von erheblichen Verbesserungen sowohl in der Trainingszeit als auch in der Genauigkeit.
He et al. (Sat,) untersuchten diese Frage.