Key points are not available for this paper at this time.
La sélection de caractéristiques pour la classification multiclass est une tâche d'une importance critique pour la reconnaissance de motifs et les applications d'apprentissage automatique. La sélection d'un sous-ensemble optimal de caractéristiques à partir de données de haute dimension, qui ont généralement beaucoup plus de variables que d'observations et contiennent un bruit significatif, des composants manquants ou des valeurs aberrantes, est particulièrement difficile. Les méthodes existantes ne peuvent soit pas traiter les données de haute dimension de manière efficace ou évolutive, soit ne peuvent obtenir qu'un optimum local au lieu d'un optimum global. Afin de sélectionner efficacement le sous-ensemble de caractéristiques globalement optimal, nous introduisons un nouveau sélecteur -- que nous appelons le sélecteur Fisher-Markov -- pour identifier les caractéristiques les plus utiles pour décrire les différences essentielles entre les groupes possibles. En particulier, dans cet article, nous présentons une méthode pour représenter les caractéristiques discriminantes essentielles avec la parcimonie comme objectif d'optimisation. Avec des mesures correctement identifiées pour la parcimonie et la discriminativité dans des environnements de haute dimension, nous adoptons une approche systématique pour optimiser les mesures afin de choisir le meilleur sous-ensemble de caractéristiques. Nous utilisons des techniques d'optimisation de champs aléatoires de Markov pour résoudre les fonctions objectives formulées pour la sélection simultanée des caractéristiques. Nos résultats ne sont pas combinatoires, et ils peuvent atteindre l'exact global optimum de la fonction objective pour certains noyaux spéciaux. La méthode est rapide ; en particulier, elle peut être linéaire par rapport au nombre de caractéristiques et quadratique par rapport au nombre d'observations. Nous appliquons notre procédure à une variété de données du monde réel, y compris un ensemble de données de chiffres manuscrits optiques de dimension moyenne et des ensembles de données d'expression génique de microarray de haute dimension. L'efficacité de notre méthode est confirmée par des résultats expérimentaux. En reconnaissance de motifs et d'un point de vue de sélection de modèle, notre procédure indique qu'il est possible de sélectionner le sous-ensemble de variables le plus discriminant en résolvant une fonction objective très simple sans contrainte qui peut en fait être obtenue avec une expression explicite.
Cheng et al. (Mar,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: