Key points are not available for this paper at this time.
Die Merkmalsselektion ist eine wichtige Aufgabe im effektiven Data Mining. Eine neue Herausforderung für die Merkmalsselektion ist das sogenannte "Problem der kleinen beschrifteten Stichprobe", bei dem die beschrifteten Daten klein und die unbeschrifteten Daten groß sind. Der Mangel an beschrifteten Instanzen bietet unzureichende Informationen über die Struktur des Zielkonzepts und kann dazu führen, dass überwachtes Merkmalsselektion-Algorithmen scheitern. Unüberwachte Merkmalsselektion-Algorithmen können ohne beschriftete Daten arbeiten. Diese Algorithmen ignorieren jedoch die Labelinformationen, was zu einer Leistungsverschlechterung führen kann. In dieser Arbeit schlagen wir vor, sowohl (kleine) beschriftete als auch (große) unbeschriftete Daten in der Merkmalsselektion zu verwenden, ein Thema, das in der Forschung zur Merkmalsselektion noch nicht behandelt wurde. Wir präsentieren einen semi-überwachten Merkmalsselektionsalgorithmus basierend auf Spektralanalyse. Der Algorithmus nutzt sowohl beschriftete als auch unbeschriftete Daten durch einen Regularisierungsrahmen, der einen effektiven Weg bietet, um das Problem der "kleinen beschrifteten Stichprobe" anzugehen. Experimentelle Ergebnisse haben die Wirksamkeit unseres Ansatzes bestätigt und gezeigt, dass kleine beschriftete Stichproben zur Merkmalsauswahl mit unbeschrifteten Daten beitragen können.
Zhao et al. (Thu,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: