AntecedentesOs chatbots baseados em IA estão sendo cada vez mais utilizados como fontes de informação em saúde. No entanto, sua confiabilidade em fornecer respostas precisas e cientificamente fundamentadas às perguntas dos pacientes permanece incerta, especialmente em doenças crônicas como a doença pulmonar obstrutiva crônica (DPOC). Este estudo tem como objetivo comparar a confiabilidade do ChatGPT-4o e do Gemini 2.5 Flash na provisão de informações médicas centradas no paciente sobre DPOC.MétodosUm total de 34 perguntas públicas comuns sobre DPOC foram submetidas ao ChatGPT-4o e ao Gemini 2.5 Flash. As respostas foram avaliadas de forma cega por quatro pneumologistas em três domínios: precisão, clareza e adequação científica. As médias das pontuações e as contagens de palavras foram analisadas e comparadas por meio de testes não paramétricos.ResultadosO Gemini 2.5 Flash superou o ChatGPT-4o em termos de adequação científica (pontuação média: 4.69 ± 0.31 vs. 4.34 ± 0.45, pp<0.001). Ambos os modelos forneceram respostas geralmente aceitáveis, mas as respostas do ChatGPT-4o eram mais curtas e ocasionalmente menos completas.ConclusõesEmbora ambos os modelos tenham fornecido conteúdo em grande parte preciso e compreensível, o Gemini 2.5 Flash tendia a produzir respostas mais detalhadas e recebeu classificações mais altas de adequação científica; no entanto, essa diferença deve ser interpretada à luz do substancial desequilíbrio na extensão das respostas. Essas ferramentas podem apoiar a educação do paciente, no entanto, os achados refletem uma comparação apenas entre sistemas de IA e devem ser interpretados dentro deste escopo.
Güçsav et al. (Quarta-feira,) estudaram esta questão.