Key points are not available for this paper at this time.
In dieser Arbeit präsentieren wir eine datengestützte Simulations- und Trainingsengine, die in der Lage ist, End-to-End-Steuerungspolitiken für autonome Fahrzeuge zu lernen, indem sie nur spärliche Belohnungen nutzt. Durch die Nutzung realer, von Menschen gesammelter Trajektorien durch eine Umgebung generieren wir neuartige Trainingsdaten, die es virtuellen Agenten ermöglichen, entlang eines Kontinuums neuer lokaler Trajektorien zu fahren, die mit dem Erscheinungsbild und der Semantik der Straße übereinstimmen, jeweils mit einer anderen Sicht auf die Szene. Wir demonstrieren die Fähigkeit der innerhalb unseres Simulators gelernten Politiken, auf zuvor unbekannte reale Straßen zu verallgemeinern und sich dort zu bewegen, ohne während des Trainings Zugriff auf menschliche Steuerungslabels zu haben. Unsere Ergebnisse validieren die erlernte Politik an einem vollmaßstäblichen autonomen Fahrzeug, einschließlich in zuvor nicht angetroffenen Szenarien, wie neuen Straßen und neuartigen, komplexen, nahen Unfallsituationen. Unsere Methoden sind skalierbar, nutzen Verstärkungslernen und wenden sich breit auf Situationen an, die effektive Wahrnehmung und robuste Operationen in der physischen Welt erfordern.
Amini et al. (Mon,) untersuchten diese Frage.