Key points are not available for this paper at this time.
Resumo Contextos Modelos de linguagem de grande porte (LLMs) estão avançando rapidamente e demonstrando alto desempenho na compreensão de informações textuais, sugerindo aplicações potenciais na interpretação de históricos clínicos e achados de imagem documentados. Os LLMs estão avançando rapidamente e espera-se uma melhora em sua capacidade diagnóstica. Além disso, tem havido uma falta de comparações abrangentes entre LLMs de vários fabricantes. Objetivo Testamos o desempenho diagnóstico dos três principais LLMs mais recentes (GPT-4o, Claude 3 Opus e Gemini 1.5 Pro) usando casos de Radiologia Diagnosis Please, uma série mensal de quizzes diagnósticos para especialistas em radiologia. Materiais e Métodos Histórias clínicas e achados de imagem fornecidos textualmente pelos remetentes dos casos foram extraídos de 324 perguntas de quizzes dos casos de Radiologia Diagnosis Please. O GPT-4o, Claude 3 Opus e Gemini 1.5 Pro geraram os três principais diagnósticos diferenciais. O desempenho diagnóstico entre os três LLMs foi comparado usando o Q de Cochrane e testes pós-hoc de McNemar. Resultados As acurácias diagnósticas para o diagnóstico primário foram 41,0%, 54,0% e 33,9% para GPT-4o, Claude 3 Opus e Gemini 1.5 Pro, respectivamente. Ao considerar a acurácia de qualquer um dos três principais diagnósticos diferenciais, as taxas melhoraram para 49,4%, 62,0% e 41,0%, respectivamente. Diferenças significativas no desempenho diagnóstico foram observadas entre todos os pares dos modelos. Conclusão Em uma comparação dos LLMs mais recentes, o Claude 3 Opus superou o GPT-4o e Gemini 1.5 Pro na resolução de casos de quiz de radiologia. Esses modelos parecem ser capazes de auxiliar radiologistas quando fornecidos com avaliações precisas e descrições textuais dos achados de imagem por radiologistas. Declaração resumida O Claude 3 Opus alcançou a maior acurácia diagnóstica, seguido pelo GPT-4o e Gemini 1.5 Pro, em uma comparação de seu desempenho em 324 casos textuais de Radiologia Diagnosis Please. Principais Resultados Este estudo comparou os desempenhos diagnósticos dos últimos três principais modelos de linguagem de grande porte, GPT-4o, Claude 3 Opus e Gemini 1.5 Pro, usando histórico clínico e achados de imagem textualizados nos casos de Radiologia Diagnosis Please. Os três principais diagnósticos diferenciais gerados por GPT-4o, Claude 3 Opus e Gemini 1.5 Pro alcançaram acurácias diagnósticas de 49,4%, 62,0% e 41,0%, respectivamente, com diferenças estatisticamente significativas entre o desempenho de cada modelo.
Sonoda et al. (Mon,) estudaram esta questão.