Key points are not available for this paper at this time.
A avaliação par a par usando grandes modelos de linguagem (LLMs) é amplamente utilizada para avaliar tarefas de geração de linguagem natural (NLG). No entanto, a confiabilidade dos LLMs é frequentemente comprometida por viés, como a preferência por verbosidade e tom autoritário. Neste estudo, focamos na comparação de duas abordagens de avaliação baseadas em LLM, pontual e par a par. Nossos resultados demonstram que os avaliadores pontuais exibem mais robustez contra preferências indesejáveis. Análises adicionais revelam que os avaliadores par a par podem identificar com precisão as deficiências de saídas de baixa qualidade, mesmo quando seu julgamento está incorreto. Esses resultados indicam que os LLMs são mais severamente influenciados por seu viés em um cenário de avaliação par a par. Para mitigar isso, propomos um método híbrido que integra raciocínio pontual na avaliação par a par. Resultados experimentais mostram que nosso método melhora a robustez dos avaliadores par a par contra amostras adversariais, enquanto preserva a precisão em amostras normais.
Jeong et al. (2024) estudaram esta questão.