Key points are not available for this paper at this time.
尽管最近在扩展大型语言模型(LLMs)方面的进展导致许多自然语言处理(NLP)任务的改善,但尚不清楚这些主要通过通用网络文本训练的模型是否适用于临床文本等高度专业和安全关键的领域。最近的研究结果表明,LLMs编码了惊人的医学知识。这引发了一个重要问题,即小型领域特定语言模型的功用。随着一般领域LLMs的成功,是否仍然需要专用的临床模型?为了探讨这个问题,我们对12种语言模型进行了广泛的实证分析,这些模型的参数范围从2.2亿到1750亿,测量它们在3项不同临床任务上的表现,测试它们解析和推理电子健康记录的能力。作为实验的一部分,我们从头开始在MIMIC III和IV的临床笔记上训练了T5-Base和T5-Large模型,以直接调查临床标记的效率。我们展示了相对较小的专用临床模型明显优于所有上下文学习方法,即使在有限标注数据上进行微调。此外,我们发现对临床标记进行预训练可以得到更小、更具参数效率的模型,这些模型要么与在通用文本上训练的大型语言模型相匹配,要么超过它们。我们根据PhysioNet凭证健康数据许可证和数据使用协议发布了所使用的代码和模型。
Lehman等(周四)研究了这个问题。