Synapse
⌘+K
Synapse
PulseExploreClubsResearchersJournals
Instagram
HomeClubsExplore
September 14, 2026Frontiers in Research Metrics and AnalyticsOpen Access

Conditional validity in LLM-mediated L2 assessment: an argument-based systematic review and meta-analysis

View Full Paper
Ask AI
Bookmark
Share

Authors

LALatifah Hamdan AlghamdiTATalal Musaed Alghizzi

Discussion

Loading...

Member takes

Overview

Systematic review and meta-analysis reveals moderate validity for LLM scoring in second-language assessment, indicating that autonomous high-stakes testing remains unsupported.

Key Points

  • To evaluate when large language model scoring and feedback are psychometrically and educationally defensible in second-language assessment using an argument-based validity framework.
  • Followed PRISMA 2020 guidelines to systematically search nine databases, identifying 52 empirical studies published between January 2022 and December 2025.
  • Conducted meta-analyses using REML random-effects models to pool Pearson correlation coefficients for scoring correspondence and Hedges' g for formative feedback outcomes.
  • Human-LLM score correspondence showed moderate agreement across three verified studies (r = 0.66, 95% CI [0.53, 0.75], I² = 70.8%), with the strongest validity observed under rubric-guided and human-supervised conditions.
  • Formative feedback mediated by language models yielded a small-to-moderate positive effect on revision quality and short-term writing performance across 14 studies (Hedges' g = 0.42, 95% CI [0.27, 0.57], I² = 69.8%).

Cite This Study

Alghamdi et al. (2026) studied this question.

synapsesocial.com/papers/6aa7b2e10926e14a848b1696https://doi.org/10.3389/frma.2026.1908592
View Full Paper
Ask AI
Bookmark
Share

Also Consider

Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context:

  1. 1Scoring employment interviews with large language models: Evaluation design components, validity investigations, and best practice recommendations.2026 · 1 citations
  2. 2Utilizing large language models for EFL essay grading: An examination of reliability and validity in rubric‐based assessments2024 · 110 citations
  3. 3A Framework for Evaluation of Large Language Models in Essay Assessment: Reliability, Alignment, and Causal Reasoning2026 · 1 citations
  4. 4LLM-Assisted Scoring for College English Writing Assessment: Statistical Calibration Against Teacher Standards2026
  5. 5LLM-Generated Feedback in L2 Writing: A Scoping Review2026