Key points are not available for this paper at this time.
De nos jours, les textes courts sont très répandus dans diverses applications web, telles que les microblogs et la messagerie instantanée. La forte parcimonie des textes courts empêche les modèles thématiques existants d'apprendre des thématiques fiables. Dans cet article, nous proposons une nouvelle approche pour aborder ce problème. L'idée clé consiste à apprendre des thématiques en explorant les données de corrélation de termes, plutôt que les informations d'occurrence de termes hautement dimensionnelles et parcimonieuses dans les documents. De telles données de corrélation de termes sont moins parcimonieuses et plus stables à mesure que la taille du corpus augmente, et peuvent parfaitement capturer les informations nécessaires à l'apprentissage des thématiques. Pour obtenir des thématiques fiables à partir des données de corrélation de termes, nous introduisons d'abord une nouvelle façon de calculer la corrélation de termes dans des textes courts en représentant chaque terme par ses termes cooccurrents. Nous formulons ensuite le problème d'apprentissage des thématiques sous forme de factorisation matricielle non négative symétrique sur la matrice de corrélation de termes. Après l'apprentissage des thématiques, nous pouvons facilement déduire les thématiques des documents. Les résultats expérimentaux sur trois jeux de données montrent que notre méthode offre des performances nettement supérieures à celles des méthodes de référence.
Yan et al. (Thu,) ont étudié cette question.