Synapse
⌘+K
Synapse
PulseExploreClubsResearchersJournals
Instagram
HomeClubsExplore
June 27, 2025SHILAP Revista de lepidopterologíaOpen Access

Performance of Large Language Models in the Non-English Context: Qualitative Study of Models Trained on Different Languages in Chinese Medical Examinations

View Full Paper
Ask AI
Bookmark
Share

Authors

ZYZhong YaoShandong UniversityLDLirui DuanKunming UniversitySXShuo XuQilu Hospital of Shandong University

Discussion

Loading...

Member takes

Implication

Qualitative study reveals Chinese-trained models outperform English models on Chinese medical exams, indicating training data differences drive benchmark performance.

Key Points

  • To evaluate and contrast the clinical benchmark performance of large language models trained predominantly on English corpora versus Chinese corpora within the Chinese National Medical Licensing Examination.
  • Assessed performance differences between Chinese-centric models and English-trained models, including ChatGPT, on Chinese National Medical Licensing Examination questions.
  • Implemented a cross-verification evaluation strategy using multiple distinct large language models to assess diagnostic accuracy.
  • Models trained on Chinese corpora outperformed English-trained systems, although both groups demonstrated capable baseline performance on the examination.
  • Discrepancies in model efficacy arose primarily from variations in pretraining corpus data rather than translation or communication difficulties.
  • Cross-verification across multiple distinct models produced superior examination accuracy compared to single-model assessments.

Cite This Study

Yao et al. (2025) studied this question.

synapsesocial.com/papers/69d6cb7d75cae9790bed8bedhttps://doi.org/10.2196/69485
View Full Paper
Ask AI
Bookmark
Share

Also Consider

Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context:

  1. 1Development and evaluation of a large language model of ophthalmology in Chinese2024 · 25 citations
  2. 2PMC-LLaMA: toward building open-source language models for medicine2024 · 302 citations
  3. 3Evaluating large language models as agents in the clinic2024 · 145 citations
  4. 4Assessing ChatGPT as a Medical Consultation Assistant for Chronic Hepatitis B: Cross-Language Study of English and Chinese2024 · 23 citations
  5. 5A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity2023 · 665 citations