Key points are not available for this paper at this time.
现有关于长期开放域对话的研究集中于评估模型在不超过五次聊天会话的上下文中的响应。尽管在长上下文大型语言模型(LLMs)和检索增强生成(RAG)技术方面取得了进展,但它们在超长期对话中的有效性仍未得到探讨。为了解决这个研究空白,我们引入了一种机器-人类pipeline,通过利用基于LLM的代理架构并将其对话基于角色和时间事件图来生成高质量的超长期对话。此外,我们为每个代理配备了共享和反应图像的能力。生成的对话经过人工注释者的验证和编辑,以确保长期一致性和与事件图的基础对接。通过这个pipeline,我们收集了LoCoMo,一组超长期对话数据集,每个数据集包含300轮对话,平均包含9K个标记,涉及最多35个会话。基于LoCoMo,我们提出了一个全面的评估基准,以衡量模型中的长期记忆,包括问答、事件摘要和多模态对话生成任务。我们的实验结果表明,LLMs在理解冗长对话和理解对话中的长期时间和因果动态方面存在挑战。采用长上下文LLMs或RAG等策略可以提供改善,但这些模型仍远远落后于人类的表现.
Maharana 等人(周二)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: