PulseExploreJournal ClubDebatesTrendingResearchersJournals
Instagram
HomeExploreJournal ClubTrending
Synapse
⌘+K
Synapse
March 14, 2026Atlas Universitesi Tip ve Saglik Bilimleri Dergisi0 citations

Comparative evaluation of ChatGPT, Google Gemini and orthopedic surgeons in orthopedic trauma decision-making

View Full Paper
GGGÖKHAN GÜZELHCHASAN CEYLAN

Key Points

  • This study evaluates the accuracy and clinical reasoning of ChatGPT and Google Gemini in orthopedic trauma compared to orthopedic surgeons.
  • Developed 60 orthopedic trauma questions spanning upper and lower extremities and pediatric trauma.
  • Responses were obtained from ChatGPT, Google Gemini, and two independent orthopedic surgeons.
  • Responses evaluated for accuracy and clinical safety by senior orthopedic surgeons using a grading system.
  • Statistical analysis conducted using chi-square and Fisher’s exact test.
  • Overall accuracy was 83.3% for ChatGPT, 80.0% for Gemini, and 91.7% for surgeons (p < 0.05).
  • AI systems performed better on theoretical questions than on clinical scenarios.
  • Potentially unsafe responses were found in 5.0% of ChatGPT and 8.3% of Gemini responses, compared to 1.7% for surgeons.

Abstract

Giriş: Büyük dil modelleri (LLM), tıp eğitimi ve klinik destek dahil olmak üzere sağlık hizmetlerinin birçok alanında giderek daha fazla kullanılmaktadır. Bununla birlikte, ortopedik travma gibi yüksek riskli klinik alanlardaki güvenilirlikleri henüz net değildir. Bu çalışma, ortopedik travma sorularında ChatGPT ve Google Gemini’nin doğruluk, klinik muhakeme performansı ve potansiyel klinik risk düzeylerini karşılaştırmayı ve bu performansı ortopedi cerrahlarının performansı ile kıyaslamayı amaçlamıştır. Gereç ve Yöntem: Üst ekstremite, alt ekstremite, pediatrik travma ve acil durumları kapsayan toplam 60 ortopedik travma sorusu (30 teorik ve 30 klinik senaryo tabanlı) hazırlanmıştır. Yanıtlar ChatGPT, Google Gemini ve iki bağımsız ortopedi cerrahından elde edilmiştir. Tüm yanıtlar anonimleştirilmiş ve iki kıdemli ortopedi cerrahı tarafından doğru, kısmen doğru, yanlış veya potansiyel olarak klinik açıdan güvensiz olarak değerlendirilmiştir. İstatistiksel analizler ki-kare ve Fisher’ın kesin testi kullanılarak yapılmıştır. Bulgular: Genel doğruluk oranı ChatGPT için %83,3, Gemini için %80,0 ve ortopedi cerrahları için %91,7 olarak bulunmuştur (p <0,05). Yapay zekâ sistemleri teorik sorularda klinik senaryolara kıyasla daha iyi performans göstermiştir. Potansiyel olarak klinik açıdan güvensiz yanıtlar ChatGPT yanıtlarının %5,0’ında, Gemini yanıtlarının %8,3’ünde ve cerrah yanıtlarının %1,7’sinde görülmüştür. Güvensiz yanıtlar açısından cerrahlar ile Gemini arasındaki fark istatistiksel olarak anlamlı bulunmuştur. Sonuç: Güncel büyük dil modelleri ortopedik travma sorularında yüksek doğruluk göstermesine rağmen, özellikle klinik senaryo temelli muhakemede eğitimli ortopedi cerrahlarının gerisinde kalmaktadır. LLM’ler destekleyici eğitim araçları olarak hizmet edebilir, ancak yüksek riskli travma karar verme süreçlerinde insan denetimi zorunlu olmaya devam etmektedir.

Ask AI
Helpful
Bookmark
Share
View Full Paper

Cite This Study

GÜZEL et al. (2026) studied this question.

synapsesocial.com/papers/69b4adc718185d8a398019b8https://doi.org/10.54270/atljm.2026.113
Ask AI
Helpful
Bookmark
Share
View Full Paper

Also Consider

Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context:

  1. 1Can Large Language Models Reliably Educate Patients After Kyphoplasty? A Clinician-Rated Comparative Study of ChatGPT and Gemini2026
  2. 2Evaluation of the effectiveness of artificial intelligence models in the Polish State Specialization Exam in orthopedics and traumatology of the musculoskeletal system2026 · 1 citations
  3. 3Do ChatGPT and Gemini’s Recommendations Align With Established Guidelines for Hand and Upper Extremity Surgery?2025
  4. 4Large language models as assistance for glaucoma surgical cases: a ChatGPT vs. Google Gemini comparison2024 · 47 citations
  5. 5COMPARATIVE EVALUATION OF CHATGPT AND GEMINI RESPONSES TO MUSCULOSKELETAL TRAUMA2026