Key points are not available for this paper at this time.
增强了监督微调和基于人类反馈的强化学习的一般大型语言模型在学术界和工业界越来越受欢迎,因为它们能够将基础模型快速推广到各种实际任务中。为了帮助用户在实际应用场景中选择最佳模型,即选择符合应用需求并最小化成本的模型,我们引入了A-Eval,这是针对一般大型语言模型的面向应用的评估基准。首先,从实际应用的角度,我们将评估任务分为五个主要类别和27个子类别。接下来,我们通过收集、注释和审核的过程构建了一个包含678对问答的数据集。然后,我们设计了一种客观有效的评估方法,并在A-Eval上评估了一系列不同规模的LLMs。最后,我们揭示了关于模型规模和任务难度水平的有趣规律,并提出了一种可行的选择最佳模型的方法。通过A-Eval,我们为选择最佳模型提供了清晰的实证和工程指导,降低了选择和使用LLMs的门槛,促进了它们的应用和发展。我们的基准公开可用,网址为 https://github.com/UnicomAI/DataSet/tree/main/TestData/GeneralAbility.
Lian等人(周五)研究了这个问题。