Die Erreichung stabiler zweibeiniger Fortbewegung für humanoide Roboter bleibt eine zentrale Herausforderung im Verstärkungslernen (RL), in dem das Design von Belohnungsfunktionen entscheidend, aber nicht trivial ist. Dieses Papier schlägt ein drei-stufiges statistisches Belohnungsformatierungsrahmenwerk vor, um das Lernen des zweibeinigen Gangs zu optimieren. Zuerst werden die Trainingsergebnisse diagnostisch überwacht, indem der VorwärtAbstand, die Sturzrate und der Haltungswert verwendet werden. Anschließend werden Pearson-Korrelation und Regressionsanalysen eingesetzt, um Kompromisse zu identifizieren und die direkten Auswirkungen von Belohnungskomponenten zu isolieren. Schließlich ermöglichen gezielte Parameter-Scans eine verwaltungsgeführte Optimierung, die das heuristische Abstimmen von Parametern erheblich reduziert und gleichzeitig eine Belohnungsfunktion für den H1-Roboter im Isaac Lab verfeinert. Experimentelle Ergebnisse zeigen deutliche Verbesserungen gegenüber der Basislinie. Die optimierte Politik reduziert die Konvergenzzeit um 14 % und erhöht den VorwärtAbstand um 186 %. Die Stabilität wird deutlich verbessert, wobei die Sturzrate von 75 % auf 2 % sinkt und die aktive Fortbewegungseffizienz sich nahezu verdoppelt (0,339 auf 0,678). Diese Ergebnisse validieren ein reproduzierbares, datengestütztes Rahmenwerk für das Belohnungsdesign und heben die Bedeutung einer fundierten statistischen Analyse in komplexer RL-basierter humanoider Fortbewegung hervor.
Yan et al. (2026) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: