Diese Dissertation untersucht, wie eine Verringerung von Versuch und Irrtum in Reinforcement Learning (RL) die Performanz, Sicherheit und Verlässlichkeit von RL-Agenten erhöhen kann. Die Grundlage hierfür wird durch die Entwicklung aussagekräftiger Datenrepräsentationen gelegt, die verlässlichere Vorhersagen ermöglichen und Entscheidungen nachvollziehbarer machen. Zudem wird gezeigt, wie physikalisches und kausales Schlussfolgern zielgerichteteres Handeln erlaubt. Die präsentierten Studien quantifizieren die Vorteile modularer, interpretierbarer und dynamikorientierter Repräsentationen, geben eine Übersicht über physikalisches Schlussfolgern im maschinellen Lernen und stellen ein dafür einsetzbares Diffusionsmodell vor. Zusätzlich werden Fallstricke moderner kausaler Lernverfahren analysiert und adressiert. Insgesamt weisen die Ergebnisse Wege zu RL-Agenten, die durch Repräsentationslernen und Schlussfolgern weniger auf Lernen durch Versuch und Irrtum angewiesen sind.
Moritz Lange (Thu,) studied this question.