Key points are not available for this paper at this time.
Dans cet article, nous proposons une méthode de sélection de caractéristiques renforcée basée sur Monte Carlo à agent unique (MCRFS), ainsi que deux stratégies d'amélioration de l'efficacité, à savoir la stratégie d'arrêt précoce (ES) et la stratégie d'interaction au niveau de la récompense (RI). La sélection de caractéristiques est l'une des technologies les plus importantes dans le prétraitement des données, visant à trouver le sous-ensemble de caractéristiques optimal pour une tâche d'apprentissage automatique aval donnée. De nombreuses recherches ont été menées pour améliorer son efficacité. Récemment, la sélection de caractéristiques renforcée à plusieurs agents (MARFS) a obtenu un grand succès dans l'amélioration de la performance de la sélection de caractéristiques. Cependant, le MARFS souffre d'un lourd fardeau de coût computationnel, ce qui limite considérablement son application dans des scénarios du monde réel. Dans cet article, nous proposons une méthode de sélection de caractéristiques efficace, qui utilise un agent pour parcourir l'ensemble du jeu de caractéristiques et décide de sélectionner ou non chaque caractéristique une par une. Plus précisément, nous développons d'abord une politique de comportement et l'utilisons pour parcourir l'ensemble des caractéristiques et générer des données d'entraînement. Ensuite, nous évaluons la politique cible basée sur les données d'entraînement et améliorons la politique cible par l'équation de Bellman. De plus, nous effectuons l'échantillonnage d'importance de manière incrémentale et proposons une stratégie d'arrêt précoce pour améliorer l'efficacité de l'entraînement par la suppression des données biaisées. Dans la stratégie d'arrêt précoce, la politique de comportement arrête son parcours avec une probabilité inversement proportionnelle au poids d'échantillonnage d'importance. En outre, nous proposons une stratégie d'interaction au niveau de la récompense pour améliorer l'efficacité de l'entraînement via un conseil externe au niveau de la récompense. Enfin, nous concevons des expériences étendues sur des données du monde réel pour démontrer la supériorité de la méthode proposée.
Liu et al. (Mercredi,) ont étudié cette question.