Key points are not available for this paper at this time.
Résumé La recherche sur la détection du sarcasme en langue bengali peut jusqu'à présent être considérée comme étroite en raison de l'absence de ressources. Dans cet article, nous introduisons un corpus bengali auto-annoté à grande échelle pour le problème de recherche de détection du sarcasme en langue bengali nommé ‘Ben-Sarc’ contenant 25 636 commentaires, collectés manuellement à partir de différentes pages Facebook publiques et évalués par des évaluateurs externes. Nous présentons ensuite une stratégie complète pour utiliser différents modèles d'apprentissage automatique traditionnel, d'apprentissage profond et d'apprentissage par transfert pour détecter le sarcasme dans le texte en utilisant le corpus Ben-Sarc. Enfin, nous démontrons une comparaison entre la performance des modèles d'apprentissage automatique traditionnel, d'apprentissage profond et d'apprentissage par transfert sur notre corpus Ben-Sarc. L'apprentissage par transfert utilisant les représentations d'encodeur bidirectionnel des transformateurs bengalis d'Indic-Transformers en tant que modèle source pré-entraîné a atteint la plus haute précision de 75,05 %. La deuxième précision la plus élevée est obtenue par le modèle de mémoire à long terme et à court terme avec 72,48 % et le modèle Multinomial Naive Bayes obtient la troisième plus haute précision avec 72,36 % pour l'apprentissage profond et l'apprentissage automatique, respectivement. Le corpus Ben-Sarc est rendu disponible au public dans l'espoir d'avancer la communauté de traitement du langage naturel bengali. Le Ben-Sarc est disponible à l'adresse https://github.com/sanzanalora/Ben-Sarc.
Lora et al. (2024) ont étudié cette question.