Key points are not available for this paper at this time.
Empfehlungssysteme sind ein allgegenwärtiges Merkmal von Online-Plattformen. Zunehmend werden sie ausdrücklich damit beauftragt, die langfristige Zufriedenheit der Nutzer zu erhöhen. In diesem Zusammenhang untersuchen wir eine Inhaltserkundungsaufgabe, die wir als Problem eines Mehrarmigen Banditen mit verzögerten Belohnungen formal beschreiben. Wir beobachten, dass es einen offensichtlichen Kompromiss bei der Wahl des Lernsignals gibt: Das Warten auf die vollständige Belohnung kann mehrere Wochen in Anspruch nehmen, was die Lernrate negativ beeinflusst, während die Messung kurzfristiger Proxy-Belohnungen das tatsächliche langfristige Ziel nur unvollkommen widerspiegelt. Wir gehen diese Herausforderung in zwei Schritten an. Zuerst entwickeln wir ein prädiktives Modell für verzögerte Belohnungen, das alle bisher gewonnenen Informationen einbezieht. Vollständige Beobachtungen sowie teilweise (kurz- oder mittelfristige) Ergebnisse werden durch einen Bayesschen Filter kombiniert, um einen probabilistischen Glauben zu erhalten. Zweitens entwerfen wir einen Banditenalgorithmus, der von diesem neuen prädiktiven Modell profitiert. Der Algorithmus lernt schnell, Inhalte zu identifizieren, die mit langfristigem Erfolg übereinstimmen, indem er Exploration und Exploitation sorgfältig abwägt. Wir wenden unseren Ansatz auf ein Podcast-Empfehlungsproblem an, bei dem wir versuchen, Shows zu identifizieren, mit denen die Nutzer über einen Zeitraum von zwei Monaten wiederholt interagieren. Wir validieren empirisch, dass unser Ansatz zu einer erheblich besseren Leistung im Vergleich zu Ansätzen führt, die entweder für kurzfristige Proxy-Werte optimieren oder darauf warten, dass das langfristige Ergebnis vollständig realisiert wird.
Baldwin-McDonald et al. (Fr,) haben diese Frage untersucht.