Einführung: Die Sentimentanalyse ist eine wesentliche Aufgabe im Text Mining und in der Informationsbeschaffung, mit Anwendungen, die sich über E-Commerce, Analysen sozialer Medien und politischen Diskurs erstrecken. Trotz umfangreicher Fortschritte in monolingualen Kontexten bleibt die Sentimentanalyse von gemischten Texten eine Herausforderung aufgrund sprachlicher Vermischung, des Fehlens standardisierter Ressourcen und der stark unstrukturierten Natur von Daten aus sozialen Medien. Diese Studie adressiert diese Lücke, indem sie sich auf die Sentimentanalyse im Englisch–Marathi–Konkani (En–Mr–Kn) konzentriert, einem relativ unerforschten Sprachtrio in der mehrsprachigen Verarbeitung natürlicher Sprache (NLP). Methoden: Ein Goldstandard-korpus wurde entwickelt, indem 31.884 gemischte Sätze aus verschiedenen sozialen Medienplattformen, einschließlich YouTube, WhatsApp und Facebook, gesammelt wurden. Die Sätze wurden manuell auf sentimentale Polarität annotiert, wobei die Zuverlässigkeit durch Krippendorffs Alpha validiert wurde, was zu einem hohen Interannotatoren-Zustimmungsscore von 0.911 führte. Um das Dataset zu benchmarken, wurden verschiedene Ansätze zur Sentimentklassifikation implementiert, die von traditionellem maschinellen Lernen bis hin zu Deep Learning und transformer-basierten Modellen reichten. Ergebnisse: Unter den evaluierten Modellen erreichte das mehrsprachige BERT (mBERT), das sowohl auf standardisierten als auch auf gemischten Daten feinabgestimmt wurde, die höchste Klassifizierungsgenauigkeit von 85,3%. Andere Modelle, einschließlich klassischer und Deep Learning-Techniken, zeigten wettbewerbsfähige, aber vergleichsweise geringere Leistungen. Diskussion: Die Ergebnisse heben die Effektivität von transformer-basierten Modellen bei der Behandlung von gemischten indo-arischen Sprachen hervor, insbesondere wenn sie mit kuratierten Datensätzen kombiniert werden, die authentische sprachliche Variation erfassen. Die Leistungsdifferenz zwischen mBERT und herkömmlichen Ansätzen unterstreicht die Notwendigkeit fortschrittlicher Architekturen, um die Komplexität der sentimentalen Analyse von gemischten Texten zu bewältigen. Fazit: Diese Arbeit präsentiert das erste annotierte Korpus für die Sentimentanalyse im En–Mr–Kn, wodurch eine kritische Lücke in der mehrsprachigen NLP geschlossen wird. Das öffentlich zugängliche Dataset und die baseline Implementierungen bieten eine wertvolle Grundlage für zukünftige Forschung und unterstützen den Fortschritt der Sentimentklassifikation in ressourcenarmen, gemischten Sprachkontexten.
Phadte et al. (2026) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: