Key points are not available for this paper at this time.
Zielbedingtes hierarchisches Verstärkungslernen (HRL) hat vielversprechende Ergebnisse bei der Lösung komplexer und langfristiger RL-Aufgaben gezeigt. Der Aktionsraum der hochrangigen Politik im zielbedingten HRL ist jedoch oft groß, was zu schlechter Erkundung führt und die Effizienz des Trainings verringert. In dieser Arbeit präsentieren wir HIerarchisches Verstärkungslernen, das durch Landmarken geleitet wird (HIGL), ein neuartiges Framework zur Ausbildung einer hochrangigen Politik mit einem reduzierten Aktionsraum, der durch Landmarken geleitet wird, d.h. vielversprechenden Zuständen zur Erkundung. Das Hauptbestandteil von HIGL ist zweifach: (a) das Sampling von Landmarken, die informativ für die Erkundung sind, und (b) die hochrangige Politik zu ermutigen, ein Subziel in Richtung einer ausgewählten Landmarke zu generieren. Für (a) berücksichtigen wir zwei Kriterien: die Abdeckung des gesamten besuchten Zustandsraums (d.h. die Dispersion der Zustände) und die Neuheit der Zustände (d.h. den Vorhersagefehler eines Zustandes). Für (b) wählen wir eine Landmarke als die allererste Landmarke im kürzesten Pfad in einem Graphen aus, dessen Knoten Landmarken sind. Unsere Experimente zeigen, dass unser Framework die vorherigen Methoden in einer Vielzahl von Kontrollaufgaben übertrifft, dank der effizienten Erkundung, die durch Landmarken geleitet wird.
Kim et al. (Tue,) haben diese Frage untersucht.