Key points are not available for this paper at this time.
Les approches basées sur la modélisation du langage pour la génération de scénarios tentent de construire une intrigue en échantillonnant un modèle de langage (LM) pour prédire le prochain caractère, mot ou phrase à ajouter à l'histoire. Les techniques de LM manquent de la capacité de recevoir des directives de l'utilisateur pour atteindre un objectif spécifique, ce qui entraîne des histoires qui n'ont pas une progression claire et manquent de cohérence. Nous présentons une technique d'ajustement des récompenses qui analyse un corpus narratif et produit des récompenses intermédiaires qui sont rétropropagées dans un LM pré-entraîné afin de guider le modèle vers un objectif donné. Les évaluations automatisées montrent que notre technique peut créer un modèle qui génère des scénarios qui atteignent systématiquement un objectif spécifié. Les études sur des sujets humains montrent que les histoires générées ont un ordre d'événements plus plausible que les techniques de génération de scénarios de référence.
Tambwekar et al. (Sun,) ont étudié cette question.