Key points are not available for this paper at this time.
Urdu ist eine Nationalsprache von Pakistan und wird von mehr als 200 Millionen Menschen als verbale und schriftliche Kommunikation verwendet. Es gibt eine große Menge unstrukturierter Urdu-Textdaten in der Welt; durch Anwendung von Data-Mining-Techniken können nützliche Informationen gewonnen werden. Es mangelt jedoch erheblich an Verarbeitungskapazitäten, um innovative Systeme auf der Grundlage der Urdu-Sprache zu entwickeln. In diesem Papier präsentieren die Autoren eine regelbasierte Stemming-Methode für die Urdu-Sprache, die in der Lage ist, die Herausforderungen des Urdu-Infix-Stemmings zu bewältigen. Die vorgeschlagene Stemming-Methode erzeugt den Stamm von Urdu-Wörtern, indem Präfixe, Infixe und Postfixe entfernt werden. In dieser vorgeschlagenen Urdu-Stemming-Technik haben die Autoren zwei neuartige Klassen von Urdu-Infix-Wörtern und eine neue Regel für die minimale Wortlänge eingeführt. Um den Stamm von Urdu-Wörtern zu erzeugen, die zu den vorgeschlagenen Urdu-Infix-Wortklassen gehören, werden Infix-Abtrennungsregeln entwickelt. Die vorgeschlagene Urdu-Stemming-Technik ist auch in der Lage, den Stamm von entlehnten Wörtern und zusammengesetzten Wörtern zu erzeugen. Der vorgeschlagene Ansatz wird an Urdu-Überschrift-Nachrichtendatensätzen evaluiert. Dieser vorgeschlagene Ansatz wird mit der bestehenden hochmodernen Technik (Ein leichtgewichtiger Urdu-Stemmer) verglichen, um die Wirksamkeit der vorgeschlagenen Methode zu demonstrieren. Die vorgeschlagene Methode bietet eine Genauigkeit von 90 % bis 95 % und zeigt signifikante Verbesserungen im Vergleich zur Urdu-Stemming-Technik.
Ali et al. (Fri,) haben diese Frage untersucht.