我们的目标是调查强化学习(RL)是否能够检测临床实践变异,以及迁移学习(TL)是否能够减轻不同性别和地点患者的分布偏移。我们使用2009年至2019年在加拿大阿尔伯塔省的41,000多名患有阻塞性冠心病(CAD)患者的数据进行了三项实验:1)使用离线政策评估(OPE)评估不同分层组别的医生行为政策;2)针对每个组开发并评估使用保守Q学习和OPE的RL政策;3)应用TL以提高目标组的RL表现。女患者在自己医生的政策下预期奖励显著低于男性。应用从男性患者身上学习到的医生政策提高了女性的奖励,但仍低于男性。RL政策的表现优于医生政策。仅使用10%目标组数据的TL有效缓解了分布偏移。残余混淆需要进一步研究以验证我们的发现。
Ghasemi等(Mon,)研究了这个问题。