Key points are not available for this paper at this time.
最近、大規模言語モデル(LLM)を使用して自然言語処理(NLP)タスクを自動的に評価することへの関心が高まっています。このようなシステムを人間の判断と高い相関を持つように改善するために、かなりの研究努力が注がれています。しかし、LLMに基づく自動評価システムの実用的な応用において、どの程度の相関が十分であるかはまだ不明です。本論文では、これらのLLM評価者が候補となるNLPモデルをランク付けする際の信頼性を特徴付け、設定可能なモンテカルロシミュレーション手法を開発します。人間の判断との相関が低い自動評価指標でも、合理的な評価セットサイズ(数百の例)で高い信頼性のランキングを達成できることを示します。さらに、LLM評価者のパフォーマンス(人間との相関)と評価セットサイズ間のトレードオフ曲線を説明します。相関の損失は、評価セットサイズを適度に増加させることで補償できます。私たちは、テキスト要約データセットであるRoSE上で結果を検証し、信頼性の推定が経験的観察と一致することを発見しました。
Stureborgら(Mon)はこの問題を調査しました。