Key points are not available for this paper at this time.
Wir präsentieren eine neue Methode zum Erlernen von Steuerungsrichtlinien, die erfolgreich unter unbekannten dynamischen Modellen operieren. Wir erstellen solche Richtlinien, indem wir eine große Anzahl von Trainingsbeispielen nutzen, die mit einem physischen Simulator generiert werden. Unser System besteht aus zwei Komponenten: einer universellen Richtlinie (UP) und einer Funktion für die Online-Systemidentifikation (OSI). Wir beschreiben unsere Steuerungsrichtlinie als universell, weil sie über ein breites Spektrum an dynamischen Modellen trainiert wird. Diese Variationen im dynamischen Modell können Unterschiede in der Masse und Trägheit der Roboterkomponenten, variable Reibungskoeffizienten oder die unbekannte Masse eines zu manipulierenden Objekts umfassen. Durch das Training der universellen Richtlinie mit dieser Variation ist die Steuerungsrichtlinie auf ein breiteres Spektrum möglicher Bedingungen vorbereitet, wenn sie in einer unbekannten Umgebung ausgeführt wird. Der zweite Teil unseres Systems nutzt die aktuellen Zustände und Aktionshistorien des Systems, um die Parameter des dynamischen Modells vorherzusagen. Der Wert von der Online-Systemidentifikation wird dann als Eingabe für die Steuerungsrichtlinie bereitgestellt (neben dem Systemzustand). Gemeinsam ist UP-OSI eine robuste Steuerungsrichtlinie, die über eine Vielzahl von dynamischen Modellen hinweg eingesetzt werden kann und die auch auf plötzliche Veränderungen in der Umgebung reagiert. Wir haben die Leistung dieses Systems in einer Vielzahl von Aufgaben bewertet, einschließlich des Problems des Cart-Pole-Swing-Up, des doppelten umgekehrten Pendels, der Fortbewegung eines Hoppers und des Blockwurfs eines Manipulators. UP-OSI ist bei diesen Aufgaben über ein breites Spektrum dynamischer Modelle hinweg effektiv. Darüber hinaus übertrifft UP-OSI, wenn es mit dynamischen Modellen außerhalb des Trainingsbereichs getestet wird, die universelle Richtlinie alleine, selbst wenn UP den tatsächlichen Wert der Modeldynamik erhält. Neben den Vorteilen der Schaffung robusterer Steuerungen verspricht UP-OSI auch, die Realitätsschere zwischen simulierten und realen physikalischen Systemen zu verringern.
Yu et al. (2017) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: