목적. 보호된 환자 속성을 기반으로 대규모 언어 모델(LLM)이 사회적 편향을 얼마나 나타내는지를 조사하고, 아키텍처 및 프로프트 전략과 같은 디자인 선택이 임상 결정 지원에서 이러한 관찰된 편향에 어떻게 영향을 미치는지를 결정합니다. 방법. 우리는 임상 비넷을 사용하여 세 가지 표준화된 질문-응답 데이터 세트에서 일반 목적 및 임상 훈련 모델을 포함한 여덟 개의 인기 LLM을 평가했습니다. 우리는 인구통계학이 LLM 출력에 미치는 영향을 분석하기 위해 레드팀 전략을 활용하였고, 제로샷 및 체인 오브 사고를 포함한 다양한 프로프트 기법을 비교했습니다. 결과. 우리의 실험은 보호된 그룹 간의 다양한 격차를 드러냅니다. 특히, 더 큰 모델이 반드시 덜 편향된 것은 아니었고, 의료 세부 조정이 일반 목적 모델보다 일관되게 우수하지 않았습니다. 또한, 특정 프로프트 문구가 편향 패턴에 상당한 영향을 미쳤으며, 체인 오브 생각과 같은 반성형 접근이 편향된 결과를 효과적으로 줄였습니다. 결론. LLM은 모델 아키텍처와 프로프트 엔지니어링에 의해 영향을 받는 임상 시나리오에서 상당한 사회적 편향을 나타냅니다. 이러한 발견은 임상 결정 지원 시스템에 통합하기 전에 LLM을 철저히 평가하고 향상시킬 필요성을 강조합니다. 이전 연구와 일치하게 AI 기반 의료 응용의 공정성을 보장하기 위해 추가적인 검토를 촉구합니다. 모든 코드와 데이터는 https://github.com/healthylaife/FairCDSLLM에서 이용 가능합니다. Doi: 10.
Poulain et al. (Sun,)이 이 질문을 연구했습니다.