Key points are not available for this paper at this time.
Wir führen die Diffusionspolitiken-Optimierung (DPPO) ein, einen algorithmischen Rahmen, der bewährte Praktiken für das Feintuning von diffusionsbasierten Politiken (z. B. Diffusionspolitik) in kontinuierlichen Steuerungs- und Robotik-Lernaufgaben mithilfe der Policy-Gradient-Methode (PG) aus dem Reinforcement Learning (RL) umfasst. PG-Methoden sind allgegenwärtig beim Training von RL-Politiken mit anderen Politikparametrisierung; dennoch wurde vermutet, dass sie für diffusionsbasierte Politiken weniger effizient sind. Überraschenderweise zeigen wir, dass DPPO die insgesamt stärkste Leistung und Effizienz für das Feintuning in gängigen Benchmarks im Vergleich zu anderen RL-Methoden für diffusionsbasierte Politiken sowie im Vergleich zu PG-Feintuning anderer Politikparametrisierung erzielt. Durch experimentelle Untersuchungen stellen wir fest, dass DPPO von einzigartigen Synergien zwischen RL-Feintuning und der Diffusionsparametrisierung profitiert, was zu strukturierter und auf der Manifold-Exploration, stabilen Training und starker Robustheit der Politik führt. Wir demonstrieren weiter die Stärken von DPPO in einer Vielzahl realistischer Einstellungen, einschließlich simulierter robotischer Aufgaben mit Pixelbeobachtungen und über Zero-Shot-Bereitstellung von simulationsgelerntem Politiken auf Robotikhardware in einer langfristigen, mehrstufigen Manipulationsaufgabe. Website mit Code: diffusion-ppo.github.io
Ren et al. (Sat,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: