Los puntos clave no están disponibles para este artículo en este momento.
El idioma urdu es utilizado por aproximadamente 200 millones de personas para comunicaciones habladas y escritas. La mayor parte de los datos textuales urdu no estructurados están disponibles en el mundo. Podemos emplear técnicas de minería de datos para extraer información útil de una base de datos tan grande y potencialmente informativa. Existen muchos sistemas de procesamiento de texto disponibles para procesar datos textuales no estructurados. Sin embargo, estos sistemas son en su mayoría específicos para un idioma, con una gran proporción de sistemas aplicables al texto en inglés. Esto se debe principalmente a los sistemas de preprocesamiento dependientes del idioma, principalmente la necesidad de stemming. El stemming es un paso de preprocesamiento vital en el proceso de minería de texto y su objetivo principal es reducir la forma de palabras gramaticales, por ejemplo, partes del discurso, género, tiempo, etc., a su forma raíz. En el trabajo propuesto, hemos desarrollado un método de stemming integral basado en reglas para el texto urdu. Este stemmer urdu propuesto tiene la capacidad de generar la raíz de las palabras urdu, así como de palabras prestadas que pertenecen a idiomas tomados, como árabe, persa y turco, eliminando prefijos, infijos y sufijos de las palabras. En la técnica de stemming propuesta, introdujimos seis clases novedosas de palabras infijas en urdu y una regla de longitud mínima de palabras para generar la raíz del texto urdu. Para enfrentar el desafío del stemming infijo en urdu, hemos desarrollado reglas de despojo de infijos para las clases de palabras infijas introducidas y reglas genéricas de stemming para el stemming de prefijos y sufijos. También presentamos un enfoque de clasificación probabilística para clasificar textos cortos en urdu. Se realizaron diferentes experimentos para demostrar la efectividad y eficacia del enfoque propuesto. También se hizo una comparación con enfoques existentes de última generación. Los resultados de precisión del stemming demuestran la adoptabilidad del enfoque de stemming propuesto para diversas aplicaciones de procesamiento de texto.
Ali et al. (Thu,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: