Wir stellen D2AC vor, einen neuen modellfreien Reinforcement Learning (RL) Algorithmus, der entwickelt wurde, um expressive Diffusionspolitiken effektiv online zu trainieren. Im Kern steht ein Ziel zur Verbesserung der Politik, das die hohe Varianz typischer Politikgradienten und die Komplexität der Rückpropagation über die Zeit vermeidet. Dieser stabile Lernprozess wird entscheidend durch unseren zweiten Beitrag ermöglicht: einen robusten distributionalen Kritiker, den wir durch eine Fusion von distributionalem RL und beschnittenem Double Q-Learning entwerfen. Der resulting Algorithmus ist äußerst effektiv und erreicht eine Spitzenleistung in einem Benchmark von achtzehn schwierigen RL-Aufgaben, einschließlich der Bereiche Humanoid, Dog und Shadow Hand, die sowohl dichte Belohnungen als auch zielbedingte RL-Szenarien umfassen. Über die Standardbenchmarks hinaus evaluieren wir auch eine biologisch motivierte Räuber-Beute-Aufgabe, um die Verhaltensrobustheit und die Generalisierungsfähigkeit unseres Ansatzes zu untersuchen.
Zhang et al. (Fr,) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: