La résumé de dialogue reste une tâche difficile en raison de l'ambiguïté et de l'informalité des conversations. Ce travail explore la relation entre les scores d'évaluation humaine et les métriques automatiques pour trente résumés de dialogue, et vise à identifier si ces métriques représentent la perception de qualité humaine. Les évaluateurs humains ont noté les résumés sur l'exactitude, la concision, la préservation du sens et la grammaire en utilisant une échelle de 5 points. Les scores ont été comparés avec ROUGE-1, ROUGE-2, ROUGE-L et BERTScore. Les résultats montrent un alignement modéré entre la perception humaine et BERTScore, tandis que les métriques ROUGE montrent des corrélations plus faibles. Ces résultats suggèrent que les métriques de référence capturent l'alignement sémantique plus efficacement que la qualité structurelle. Les recommandations pour améliorer la résumé incluent l'intégration de la cohérence factuelle et d'une formation consciente de la compression. L'étude souligne l'importance continue de l'évaluation humaine dans la recherche sur le résumé conversationnel.
Yunus et al. (Mon,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: