L'intelligence artificielle (IA), en particulier les modèles de langage de grande taille (LLMs) tels que ChatGPT, est de plus en plus appliquée dans l'éducation médicale pour automatiser la conception des évaluations. Cependant, des préoccupations persistent concernant l'exactitude du contenu, la profondeur cognitive et la validité psychométrique des questions à choix multiples (QCM) générées par l'IA. Une étude mixte a été réalisée pour évaluer un prompt structuré guidant ChatGPT dans la génération de QCM cliniquement pertinents avec la meilleure réponse unique en pédiatrie. Le prompt définissait le nombre d'items, la distribution des sous-domaines, la difficulté et le niveau des examinateurs. Après sept perfectionnements itératifs, ChatGPT a produit 100 QCM ciblant des étudiants en médecine de l'année clinique. Deux experts aveugles ont évalué indépendamment chaque item pour sa clarté, son exactitude, son réalisme clinique, la plausibilité des distracteurs et l'alignement cognitif. Tous les items étaient structurellement cohérents et linguistiquement solides. L'exactitude du contenu a été jugée élevée dans 87 % des items, et la clarté des énoncés dans 82 %. La plausibilité des distracteurs était acceptable dans 77 %, bien que 23 % des items contenaient au moins un distracteur implausible. L'accord entre la difficulté prédite par l'IA et celle évaluée par les experts était faible (κ = 0,06), suggérant une calibration limitée.
Al-lawama et al. (Samedi) ont étudié cette question.