Key points are not available for this paper at this time.
대형 언어 모델(LLMs)은 신속한 공학을 통해 임상 응용 분야에서 가능성을 보여주었으며, 이는 유연한 임상 예측을 허용합니다. 그러나 이들은 투명성과 의사 결정에 중요한 신뢰할 수 있는 예측 확률을 생성하는 데 어려움을 겪습니다. 명시적인 프롬프트는 LLM이 확률 추정을 생성하도록 유도할 수 있지만, 이들의 수치적 추론 한계는 신뢰성에 대한 우려를 불러일으킵니다. 우리는 텍스트 생성을 통해 도출된 명시적 확률과 올바른 레이블 토큰을 예측할 확률에서 파생된 암묵적 확률을 비교했습니다. 여섯 개의 고급 오픈 소스 LLM과 다섯 개의 의료 데이터 세트에 걸쳐, 명시적 확률은 항상 암묵적 확률에 비해 판별력, 정밀도 및 재현율에서 저조했습니다. 이 불일치는 작은 LLM 및 불균형 데이터 세트에서 더욱 두드러지며, LLM의 임상 사용을 위한 조심스러운 해석, 개선된 확률 추정 방법 및 추가 연구의 필요성을 강조합니다.
Gu 외. (목요일) 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: