Key points are not available for this paper at this time.
近期在生成性大型语言模型(LLMs)方面的进展令人瞩目,然而,这些模型生成的文本质量常常揭示出持续存在的问题。评估这些模型生成的文本质量,特别是在开放式文本中的评估,一直是一个重大挑战。为了解决这个问题,最近的研究探讨了将LLMs作为评估者的可能性。虽然单一的LLM作为评估代理显示出潜力,但充满了显著的不确定性和不稳定性。为了应对这些问题,我们提出了MATEval:一个“多智能体文本评估框架”,其中所有代理均由像GPT-4这样的LLMs扮演。MATEval框架模拟人类合作讨论的方法,整合多个代理的互动来评估开放式文本。我们的框架结合了自我反思和思维链(CoT)策略,以及反馈机制,增强了评估过程的深度和广度,并引导讨论趋向共识,而框架生成的综合评估报告包括错误定位、错误类型和评分。实验结果表明,我们的框架优于现有的开放式文本评估方法,并与人工评估的相关性最高,这证实了我们的框架在解决评估LLMs生成文本中的不确定性和不稳定性方面的有效性与进步。此外,我们的框架显著提高了工业场景中文本评估和模型迭代的效率。
Li等(周)研究了这一问题。