Los puntos clave no están disponibles para este artículo en este momento.
Evaluar automáticamente la calidad de las respuestas en sistemas de diálogo de dominio abierto es una tarea desafiante pero crucial. Las métricas de evaluación actuales a menudo no se alinean con los juicios humanos, especialmente al evaluar respuestas que son gramaticalmente correctas. Para abordar este problema, proponemos una nueva métrica, llamada CausalScore, que evalúa la relevancia de las respuestas midiendo la fuerza causal entre las historias de diálogo y las respuestas. La fuerza causal se estima utilizando tanto la dependencia incondicional como las dependencias condicionales de la historia del diálogo a las respuestas. Comparamos nuestra métrica con las métricas competitivas existentes en términos de su alineación con los juicios humanos. Nuestros resultados experimentales demuestran que CausalScore supera significativamente a las métricas de última generación existentes al alinearse mejor con los juicios humanos. Además, recopilamos un nuevo conjunto de datos de diálogo CGDIALOG+ con relaciones causales anotadas por humanos y un conjunto de juicios humanos pareados para facilitar el desarrollo de métricas automáticas futuras.
Feng et al. (Mar,) estudiaron esta cuestión.