目的 本可行性研究旨在评估最小定制的大型语言模型(LLMs)是否能通过在日本注册销售人员考试中的表现来达到自我用药支持所需的知识水平。注册销售人员为消费者提供有关在日本适当选择和安全使用非处方药的指导。我们探讨了通过简单的参考材料上传定制的LLMs,是否可以在不需要编程技能或高级提示工程的情况下,达到可比的知识水平。方法 我们使用2024年日本注册销售人员考试作为基准数据集,涵盖五个领域的838道仅文本的多项选择题。我们通过将官方考试问题开发指南作为PDF文件上传到GPT-4o,创建了定制的GPT,而不添加其他提示或指示。使用禁用网络浏览功能的零样本方法评估了GPT-4o和定制的GPT。结果 GPT-4o的整体准确率为78.40%,定制的GPT为92.36%,这一差异具有统计学意义(p < 0.001)。定制的GPT在所有五个领域的表现均显著优于GPT-4o(p < 0.05)。结论 本可行性研究表明,通过参考材料上传的最小定制可以提高知识评估的表现。然而,考试表现仅代表自我用药支持知识的间接指标。未来的研究应在实际案例场景中评估LLMs的表现,并在应用于消费者自我用药环境前评估其实用性和安全性。
Okazaki等(Sun,)研究了这个问题。