Key points are not available for this paper at this time.
摘要 背景 大量潜在有用的信息,例如患者症状、家庭和社会历史的描述,被记录为电子健康记录(EHRs)中的自由文本备注,但在大规模提取时难以可靠实现,从而限制了其在研究中的实用性。本研究旨在评估不进行任何微调的开源大型语言模型(LLMs)的“开箱即用”实现是否能够准确地从自由文本临床备注中提取健康的社会决定因素(SDoH)数据。方法 我们使用来自麻省总医院布莱根(MGB)系统的EHR数据进行了一项横断面研究,分析自由文本备注中的SDoH信息。我们随机选择了200名患者,并手动标记了九个SDoH方面。对八个先进的开源LLMs与基线模式匹配模型进行了评估。两名人工审核员提供了手动标签,达到了93%的标注者间一致性。使用整体、提到和未提到的SDoH的准确性指标以及宏观F1分数评估LLM性能。结果 LLMs的表现优于基线模式匹配方法,特别是在明确提到的SDoH方面,提到的准确率提高了多达40%。openchat₃. 5是表现最好的模型,超越了基线,在所有九个SDoH方面整体准确性均优于基线。经过提示工程优化的精细化流程减少了幻觉并提高了准确性。结论 开源LLMs是有效且可扩展的工具,用于从非结构化的EHR中提取SDoH,超越了传统的模式匹配方法。进一步的优化和领域特定的训练可以增强其在临床研究和预测分析中的实用性,提高医疗结果并解决健康差异。
Gu 等(周六)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: