Key points are not available for this paper at this time.
Der schnelle Fortschritt von künstlicher Intelligenz (KI) Chatbots hat erhebliches Interesse hinsichtlich ihrer potenziellen Anwendungen in der medizinischen Ausbildung geweckt. Diese Studie hatte zum Ziel, die Leistung des Open-Source-Modells DeepSeek-V3 bei der Beantwortung von Fragen im Stil von Radiologieprüfungen zu bewerten und dessen Genauigkeit mit der von ChatGPT-3.5 zu vergleichen. Insgesamt wurden 161 Fragen (bestehend aus 207 Elementen) zufällig aus dem Übungsbuch für die nationale Prüfung zur Qualifikation von Gesundheitsberufen ausgewählt: Radiologie. Der Fragenkatalog umfasste Einzelwahl-, Multiple-Choice-, gemeinsame Ansatz- und Fallanalysenfragen. Sowohl DeepSeek-V3 als auch ChatGPT-3.5 wurden über einen Testzeitraum von sieben Tagen mit demselben Fragenkatalog bewertet. Die Antwortgenauigkeit wurde systematisch bewertet, und statistische Analysen wurden mit dem Chi-Quadrat-Test von Pearson und dem exakten Test von Fisher durchgeführt. DeepSeek-V3 erreichte eine Gesamgenauigkeit von 72 %, was signifikant höher war als die Genauigkeit von 55,6 %, die von ChatGPT-3.5 erreicht wurde (P = 0.003), in den Bereichen Atmungssystem (P = 0.008), Kreislaufsystem (P = 0.012) und muskuloskelettales System (P = 0.021). Zusammenfassend zeigt DeepSeek erhebliches Potenzial als Bildungswerkzeug in der Radiologie, insbesondere für Wissenserinnerung und grundlegende Lernanwendungen. Allerdings deutet seine relativ schwächere Leistung bei höheren kognitiven Aufgaben und komplexen Frageformaten auf den Bedarf an weiterer Modellverfeinerung hin. Zukünftige Forschungen sollten DeepSeeks Fähigkeit zur Verarbeitung bildbasierter Fragen untersuchen und vergleichende Analysen mit fortschrittlicheren Modellen (z. B. GPT-5) durchführen, um sein Potenzial für die medizinische Ausbildung besser zu bewerten.
Pinggui Lei (2025) hat diese Frage untersucht.