Key points are not available for this paper at this time.
Cet article présente une revue systématique de la recherche empirique sur l'utilisation des grands modèles de langage (GML) pour la notation automatisée des travaux étudiants et la fourniture de rétroaction. L'étude visait à déterminer dans quelle mesure les modèles d'intelligence artificielle générative, tels que ChatGPT, peuvent remplacer les enseignants dans le processus d'évaluation. La revue a été réalisée conformément aux directives PRISMA et aux critères d'inclusion préétablis ; au final, 42 études empiriques ont été incluses dans l'analyse. Les résultats de la revue indiquent que l'efficacité des GML dans la notation est variable. Ces modèles performent bien sur des tâches à réponses fermées et des questions à réponse courte, atteignant souvent une précision comparable à celle des évaluateurs humains. Cependant, ils ont du mal à évaluer des devoirs complexes, ouverts ou subjectifs qui nécessitent une analyse approfondie ou de la créativité. La qualité des instructions fournies au modèle et l'utilisation de barèmes de notation détaillés influencent significativement la précision et la cohérence des notes générées par les GML. Les résultats suggèrent que les GML peuvent soutenir les enseignants en accélérant le processus de notation et en fournissant rapidement des rétroactions à grande échelle, mais ils ne peuvent pas remplacer complètement le jugement humain. La plus grande efficacité est atteinte dans les systèmes d'évaluation hybrides qui combinent la notation automatique pilotée par l'IA avec la supervision et la vérification des enseignants.
Jukiewicz et al. (Jeu,) ont étudié cette question.