Key points are not available for this paper at this time.
Wir präsentieren ein neuartiges unüberwachtes Lernschema, das gleichzeitig Variablen mehrerer Typen (z. B. Dokumente, Wörter und Autoren) basierend auf paarweisen Interaktionen zwischen den Typen clustert, wie sie in Ko-Kurrenzdaten beobachtet werden. In diesem Schema werden mehrere Clustering-Systeme generiert, die darauf abzielen, eine Zielfunktion zu maximieren, die die paarweise gegenseitige Information zwischen Cluster-Variablen misst. Um diese Idee umzusetzen, schlagen wir einen Algorithmus vor, der eine top-down-Clustering von einigen Variablen und ein bottom-up-Clustering der anderen Variablen mit einer lokalen Optimierungsroutine verbindet. Mit dem Fokus auf Dokumentenclustering präsentieren wir eine umfangreiche empirische Studie zu zweidimensionalen, dreidimensionalen und vierdimensionalen Anwendungen unseres Schemas unter Verwendung von sechs realen Datensätzen, einschließlich der 20 News-Gruppen (20NG) und der Enron-E-Mail-Sammlung. Unsere multidimensionalen verteilungsspezifischen Clustering-Algorithmen (MDC) übertreffen konsequent und signifikant vorherige State-of-the-Art informationstheoretische Clustering-Algorithmen.
Bekkerman et al. (Sat,) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: