Key points are not available for this paper at this time.
Wir untersuchen interaktives Lernen in einem Setting, in dem der Agent eine Antwort (z. B. eine Aktion oder Trajektorie) basierend auf einem Kontext und einer Anweisung generieren muss. Im Gegensatz zu typischen Ansätzen, die das System mit Belohnung oder Expertenaufsicht auf die Antwort trainieren, untersuchen wir das Lernen mit Rückblick-Instruktion, bei dem ein Lehrer eine Anweisung gibt, die am besten zur generierten Antwort des Agenten passt. Diese Rückblick-Einstufung der Anweisung ist oft einfacher zu geben als die Bereitstellung von Expertenaufsicht über die optimale Antwort, die Expertenwissen erfordern oder unpraktisch sein kann. Wir initiieren die theoretische Analyse des interaktiven Lernens mit Rückblick-Einstufung. Zunächst geben wir eine untere Schranke an, die zeigt, dass der Bedauern eines Algorithmus im Allgemeinen mit der Größe des Antwortraums des Agenten skalieren muss. Dann untersuchen wir ein spezialisiertes Setting, in dem die zugrunde liegende Anweisungs-Antwort-Verteilung als Matrizen mit niedrigem Rang zerlegt werden kann. Wir führen einen Algorithmus namens LORIL für dieses Setting ein und zeigen, dass sein Bedauern als T skaliert, wobei T die Anzahl der Runden ist und von dem intrinsischen Rang abhängt, jedoch nicht von der Größe des Antwortraums des Agenten. Wir präsentieren Experimente in zwei Bereichen, die zeigen, dass LORIL Baselines übertrifft, selbst wenn die Annahme des niedrigen Rangs verletzt wird.
Misra et al. (Sat,) haben diese Frage untersucht.