Key points are not available for this paper at this time.
电子健康记录(EHR)提供了大量数据,这些数据对于改善以患者为中心的结果至关重要,尽管这些数据可能会带来显著的统计挑战。特别是,EHR 数据包含大量缺失信息,如果不加以解决,可能会降低得出的结论的有效性。妥善处理 EHR 数据中的缺失数据问题的复杂性在于,有时很难区分缺失数据和负值。例如,未记录心力衰竭病史的患者可能确实没有疾病,或者临床医生可能只是没有记录该状况。减少 EHR 系统中缺失数据的方法来自多个角度,包括:增加结构化数据文档、减少数据输入错误以及利用文本解析/自然语言处理。本文重点讨论处理缺失数据的分析方法,主要是多重插补。典型 EHR 系统中可用的广泛变量提供了丰富的信息,以缓解缺失数据可能引起的偏差。缺失数据的概率可能与疾病严重程度和医疗保健利用有关,因为更不健康的患者更可能有合并症,而每次与医疗保健系统的互动提供了记录的机会。因此,任何插补过程应包括评估整体健康状况(例如,查尔森合并症指数)和医疗保健利用(例如,接触次数)的预测变量,即使这些合并症和患者接触与感兴趣的疾病无关。将 EHR 数据与其他信息来源(例如国家死亡指数和人口普查数据)链接也可以提供更少偏倚的插补变量。还需要对 EHR 数据进行额外的方法研究,并改善临床研究人员的流行病学培训。
Wells 等(星期二)研究了这个问题。