L'estimation de la difficulté des items est essentielle dans le développement de tests de langue, mais l'attention s'est récemment tournée vers la nécessité d'expliquer et de prédire cette difficulté. Cela a des implications pratiques pour le développement des items, les tests adaptatifs et la validation du construit. Les spécialistes de la mesure ont traditionnellement exploré les facteurs contribuant à la difficulté des items à travers la théorie de réponse des items explicative (EIRT). Dans l'évaluation linguistique, expliquer la difficulté reste un défi en raison de la nature complexe et contextuelle des construits linguistiques. Les avancées en intelligence artificielle (IA), notamment dans le machine learning (ML) et le traitement du langage naturel (NLP), ont élargi les possibilités, offrant des solutions évolutives et flexibles, mais peuvent compromettre l'interprétabilité, c'est-à-dire la capacité à relier les résultats au construit sous-jacent de capacité. Dans des domaines sensibles, tels que l'immigration et la citoyenneté, la génération de preuves de validation est critique, suscitant un besoin urgent de comprendre les implications de l'utilisation de modèles ML dans ce contexte. Cet article conceptuel explore le terrain d'entente entre la mesure et le machine learning, examinant comment ces traditions convergent et divergent dans la modélisation de la difficulté des items. Les compromis entre l'interprétabilité du modèle et l'application évolutive sont soulignés, et les implications discutées à la lumière de la nature de plus en plus interdisciplinaire de ce domaine, y compris les possibilités offertes par des solutions hybrides IRT-ML.
Dunn et al. (Jeudi,) ont étudié cette question.