Key points are not available for this paper at this time.
最近の進展にもかかわらず、大規模言語モデル(LLMs)がユーザーの指示にどれほど従うかを評価することは依然として未解決の問題です。言語モデルの評価方法はプロンプトベースのアプローチが増加していますが、これらの方法の正確性に関する研究は限られています。本研究では、さまざまな指標のメタ評価を行い、これらの指標がLLMsの指示遵守能力をどれほど正確に測定できるかを定量化します。私たちの調査は、300の文書-指示ペアを含む新たな短編実世界データセットriSumを収集することで行われ、各ペアには3つの回答があります。900のすべての回答は3人の人間アノテーターによって評価されました。riSumを使用して、評価方法と人間の判断との一致を分析します。最後に、確立されたベースラインを改善し、高品質な要約を必要とするコストのかかる参照ベースの指標に匹敵するLLMベースの参照不要評価方法を提案します。
Skopekら(Sun)はこの問題を研究しました。