Key points are not available for this paper at this time.
Verträge sind der wirtschaftliche Rahmen, der es einem Prinzipal ermöglicht, eine Aufgabe an einen Agenten zu delegieren – trotz nicht übereinstimmender Interessen und sogar ohne die Handlungen des Agenten direkt zu beobachten. In vielen modernen Einstellungen des verstärkenden Lernens lernen eigennützige Agenten, eine mehrstufige Aufgabe auszuführen, die ihnen von einem Prinzipal delegiert wurde. Wir untersuchen das signifikante Potenzial von Verträgen zur Anreizgestaltung für die Agenten. Wir modellieren die delegierte Aufgabe als MDP und untersuchen ein stochastisches Spiel zwischen dem Prinzipal und dem Agenten, wobei der Prinzipal lernt, welche Verträge zu verwenden sind, und der Agent in Reaktion eine MDP-Politik lernt. Wir präsentieren einen auf Lernen basierenden Algorithmus zur Optimierung der Verträge des Prinzipals, der nachweislich zum subspielperfekten Gleichgewicht des Prinzipal-Agenten-Spiels konvergiert. Eine Implementierung mittels tiefen RL ermöglicht es uns, unsere Methode auf sehr große MDPs mit unbekannten Übergangs-dynamiken anzuwenden. Wir erweitern unseren Ansatz auf mehrere Agenten und demonstrieren seine Relevanz zur Lösung eines kanonischen sequentiellen sozialen Dilemmas mit minimalem Eingriff in die Belohnungen der Agenten.
Ivanov et al. (Thu,) haben diese Frage untersucht.