Los puntos clave no están disponibles para este artículo en este momento.
Los embeddings de palabras, que representan una palabra como un punto en un espacio vectorial, se han vuelto omnipresentes en varias tareas de procesamiento del lenguaje natural (NLP). Una línea reciente de trabajo utiliza corpora bilingües (dos idiomas) para aprender un vector diferente para cada sentido de una palabra, explotando señales crosslingües para ayudar en la identificación de sentidos. Presentamos un algoritmo bayesiano no paramétrico de múltiples vistas que mejora los embeddings de palabras multi-sentido al (a) utilizar corpora multilingües (es decir, más de dos idiomas) para mejorar significativamente los embeddings de sentido más allá de lo que se logra con la información bilingüe, y (b) utilizar un enfoque fundamentado para aprender un número variable de sentidos por palabra, de manera impulsada por datos. Nuestro enfoque es el primero con la capacidad de aprovechar efectivamente los corpora multilingües para el aprendizaje de representación multi-sentido. Los experimentos muestran que la capacitación multilingüe mejora significativamente el rendimiento en comparación con la capacitación monolingüe y bilingüe, al permitirnos combinar diferentes corpora paralelos para aprovechar el contexto multilingüe. La capacitación multilingüe produce un rendimiento comparable al de un modelo monolingüe de última generación entrenado con cinco veces más datos de entrenamiento.
Upadhyay et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: