Key points are not available for this paper at this time.
在大型自然图像-文本配对数据集上训练的多模态模型表现出惊人的高质量图像生成能力。医学成像数据与自然图像在本质上是不同的,而用以简练地捕捉医学数据中相关细节的语言则使用了不同的、范围狭窄但语义丰富的领域特定词汇。不足为奇,基于自然图像-文本对训练的多模态模型往往不太能推广到医学领域。开发能够忠实表示医学概念并提供组成多样性的生成成像模型,可以缓解现有高质量注释医学影像数据集的缺乏。在本研究中,我们开发了一种通过在公开可用的胸部X射线(CXR)及其相应的放射学(文本)报告上适应预训练的潜在扩散模型,以克服自然-医学分布的大幅转变的策略。我们研究了该模型生成高保真、多样合成CXR的能力,这些CXR是以文本提示为条件生成的。我们使用图像质量指标定量评估模型输出,并通过人类领域专家评估图像质量和文本-图像对齐。我们提供了证据表明最终模型(RoentGen)能够创造视觉上令人信服、多样的合成CXR图像,并且通过使用包括放射学特定语言在内的自由形式文本提示可以在新程度上控制输出。对这个模型进行微调,并将其用作数据增强方法,我们测量到在合成图像和真实图像上联合训练的分类器的性能提高了5%,当在一个更大但完全合成的训练集上训练时提高了3%。最后,我们观察到这种微调能够提炼文本编码器的领域知识,并能将其对某些疾病(如气胸)的表征能力提高25%。
Chambon 等人(星期三)研究了这个问题。