Key points are not available for this paper at this time.
Dans de nombreuses applications réelles, l'environnement de modélisation est généralement dynamique et évolutif, en particulier dans un flux de données où de nouvelles classes émergentes se produisent souvent. D'énormes efforts ont été consacrés à l'apprentissage avec des concepts nouveaux récemment, qui se déroulent généralement dans un cadre supervisé avec une initialisation complètement supervisée. Cependant, les données collectées dans le flux sont souvent en réalité dans un mode semi-supervisé, ce qui signifie que seules quelques-unes d'entre elles sont étiquetées alors que la grande majorité manque d'étiquettes de vérité terrain. De plus, de nouvelles classes cachées dans des instances non étiquetées posent plus de défis pour la tâche d'apprentissage. Dans cet article, nous abordons ces problèmes par une nouvelle approche appelée SEEN qui se compose de trois composants majeurs : un détecteur de nouvelle classe efficace basé sur le regroupement d'arbres aléatoires, un classificateur robuste pour les prédictions sur les classes connues, et un processus de mise à jour efficace qui garantit que l'ensemble du cadre s'adapte automatiquement à l'environnement changeant. Le classificateur produit des étiquettes connues via une propagation d'étiquettes qui utilise toutes les données étiquetées et une partie des données non étiquetées dans le passé, décrivant naturellement l'ensemble du flux observé jusqu'à présent. Des études empiriques sur plusieurs ensembles de données valident que l'algorithme peut classer avec précision des points sur un flux dynamique avec un petit nombre d'exemples étiquetés et des classes émergentes.
Zhu et al. (Fri,) ont étudié cette question.