Verstärkungslernen (RL) mit kontinuierlichen Zustands- und Aktionsräumen bleibt eines der herausforderndsten Probleme auf diesem Gebiet. Die meisten aktuellen Lernmethoden konzentrieren sich auf Integritätsidentitäten wie Wertfunktionen, um eine optimale Strategie für den Lernagenten abzuleiten. In diesem Papier untersuchen wir stattdessen die duale Form der ursprünglichen RL-Formulierung, um das erste differenzielle RL-Rahmenwerk vorzuschlagen, das mit Einstellungen mit begrenzten Trainingsmustern und kurzen Episoden umgehen kann. Unser Ansatz führt Differential Policy Optimization (DPO) ein, eine punktweise und stufenweise Iterationsmethode, die Politiken optimiert, die von lokalen Bewegungsoperatoren kodiert werden. Wir beweisen eine punktweise Konvergenzschätzung für DPO und liefern eine Regret-Grenze, die mit aktuellen theoretischen Arbeiten vergleichbar ist. Diese punktweise Schätzung stellt sicher, dass die gelernte Politik den optimalen Pfad einheitlich über verschiedene Schritte hinweg trifft. Anschließend wenden wir DPO auf eine Klasse praktischer RL-Probleme an, die nach optimalen Konfigurationen mit Lagrange-Belohnungen suchen. DPO ist einfach zu implementieren, skalierbar und zeigt wettbewerbsfähige Ergebnisse in Benchmark-Experimenten gegen mehrere beliebte RL-Methoden.
Bajaj et al. (Di,) haben diese Frage untersucht.