背景:基于大型语言模型(LLMs)的AI代理可以规划任务,使用外部工具,并与其他代理协调。与标准LLMs不同,代理可以执行多步骤过程,访问实时临床信息,并整合多个数据源。尽管对使用这些代理进行临床和行政任务感兴趣,但对其性能的了解有限,以及多代理系统是否在医疗任务中比单一代理表现更好。目的:评估AI代理在医疗中的表现,比较AI代理系统与标准LLMs,并记录用于任务完成的工具。数据来源:2022年10月1日至2025年8月5日的PubMed、Web of Science和Scopus。研究选择:实施AI代理进行临床任务的经过同行评审的研究,具有定量性能比较。数据提取:两名评审者(A.G., M.O.)独立提取架构、性能指标和临床应用的数据。通过讨论解决差异,当无法达成共识时咨询第三名评审者(E.K.)。数据综合:有二十项研究符合纳入标准。在所有研究中,所有代理系统在准确性表现上均优于其基线LLMs。改进范围从小幅提升到超过60个百分点,单代理工具调用研究的中位改进为53个百分点。这些系统在诸如药物剂量和证据检索等离散任务中尤其有效。多代理系统在最多5个代理的情况下显示出最佳性能,尤其是在处理高度复杂任务时效果更为明显。当AI代理框架的复杂性与任务的复杂性相匹配时,性能提升最明显。限制:异质结果阻止了定量Meta分析。一些研究依赖于合成数据,限制了可推广性。结论:当架构与任务复杂性匹配时,AI代理始终改善基线LLMs的临床任务性能。我们的分析表明,与基线LLMs相比出现了显著变化,AI代理打开了之前无法进入的领域。未来的努力应基于前瞻性、多中心试验,使用真实世界数据来确定安全性、任务匹配和成本效益。
Gorenshtein等(周二)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: