Key points are not available for this paper at this time.
Die arabische Sprache ist eine herausfordernde Sprache für die automatische Verarbeitung. Dies liegt an mehreren intrinsischen Gründen wie arabischen Multidialekten, mehrdeutiger Syntax, syntaktischer Flexibilität und diakritischen Zeichen. Machine-Learning- und Deep-Learning-Rahmen benötigen große Datensätze für das Training, um genaue Vorhersagen zu gewährleisten. Dies führt zu einer weiteren Herausforderung, der sich Forscher mit arabischem Text gegenübersehen; da hochwertige arabische Textdatensätze immer noch selten sind. In diesem Papier wird ein intelligenter Rahmen zur Erweiterung oder Augmentierung arabischer Sätze vorgestellt. Die Sätze wurden zunächst von menschlichen Annotatoren für die Sentimentanalyse gekennzeichnet. Der neuartige Ansatz, der in dieser Arbeit präsentiert wird, basiert auf der reichen Morphologie des Arabischen, Synonymlisten, syntaktischen oder grammatischen Regeln und Negationsregeln, um neue Sätze aus den Ausgangssätzen mit den entsprechenden Etiketten zu generieren. Die meisten Augmentierungstechniken zielen auf Bild- oder Videodaten ab. Diese Studie ist die erste Arbeit, die die Textaugmentierung für die arabische Sprache zum Ziel hat. Mit diesem Rahmen konnten wir die Größe der ursprünglichen Ausgangsdatensätze um das Zehnfache erhöhen. Experimente, die die Auswirkungen dieser Augmentierung auf die Sentimentanalyse bewerten, zeigten eine durchschnittliche Steigerung der Genauigkeit um 42%, aufgrund der Zuverlässigkeit und der hohen Qualität der Regeln, die zur Erstellung dieses Rahmens verwendet wurden.
Duwairi et al. (Mon,) haben diese Frage untersucht.