Review reveals large language models generate comprehensive differential diagnoses but trail experienced physicians, suggesting clinical supervision is necessary to mitigate errors.
Key Points
To review the performance, technical adaptations, and collaborative potential of large language models in diagnostic reasoning and differential diagnosis across various clinical domains.
Synthesized literature on LLM applications in differential diagnosis, focusing primarily on internal medicine and pediatrics, with additional evidence from radiology, surgery, infectious disease, and mental health.
Analyzed technical strategies including prompting techniques, domain adaptation, external knowledge integration, and interactive clinician workflows.
LLMs generate broader and better-organized differential diagnoses comparable to medical trainees, though experienced clinicians consistently maintain higher overall diagnostic reliability.
Domain adaptation and interactive workflows improve model outputs, but persistent issues with hallucinations, automation bias, and governance remain unresolved.
Current evidence supports clinician-supervised AI implementation rather than autonomous diagnostic systems.