Key points are not available for this paper at this time.
Apresentamos um esquema inovador de aprendizado não supervisionado que simultaneamente agrupa variáveis de vários tipos (por exemplo, documentos, palavras e autores) com base em interações pareadas entre os tipos, conforme observado em dados de coocorrência. Neste esquema, múltiplos sistemas de agrupamento são gerados visando maximizar uma função objetivo que mede múltiplas informações mútuas pareadas entre variáveis de cluster. Para implementar essa ideia, propomos um algoritmo que intercala o agrupamento de cima para baixo de algumas variáveis e o agrupamento de baixo para cima das outras variáveis, com uma rotina de correção de otimização local. Focando no agrupamento de documentos, apresentamos um extenso estudo empírico de aplicações de duas, três e quatro vias do nosso esquema utilizando seis conjuntos de dados do mundo real, incluindo os 20 Grupos de Notícias (20NG) e a coleção de e-mails da Enron. Nossos algoritmos de agrupamento multilateral de distribuição (MDC) consistentemente superam, de forma significativa, algoritmos de agrupamento teórico da informação anteriores de última geração.
Bekkerman et al. (Sat,) estudaram esta questão.