Key points are not available for this paper at this time.
Modelos de Linguagem de Grande Escala (LLMs) são cada vez mais utilizados para avaliar os resultados textuais de outros LLMs, influenciando assim rankings e decisões de desenvolvimento. No entanto, persistem preocupações sobre a precisão dessas avaliações e o potencial para conclusões enganosas. Neste trabalho, investigamos a eficácia dos LLMs como avaliadores para tarefas de geração de texto. Propomos o FBI, uma nova estrutura projetada para examinar a proficiência dos LLMs Avaliadores em avaliar quatro habilidades críticas em outros LLMs: precisão factual, seguimento de instruções, coerência na escrita longa e proficiência em raciocínio. Ao introduzir perturbações direcionadas nas respostas geradas por LLMs, que impactam claramente uma dessas capacidades-chave, testamos se um LLM Avaliador pode detectar essas quedas de qualidade. Criando um total de 2400 respostas perturbadas cobrindo 22 categorias de perturbação, realizamos um estudo abrangente usando diferentes estratégias de avaliação em cinco LLMs proeminentes comumente utilizados como avaliadores na literatura. Nossos achados revelam deficiências significativas nos atuais LLMs Avaliadores, que falharam em identificar quedas de qualidade em mais de 50\% dos casos, em média. Avaliações de resposta única e pareadas demonstraram limitações notáveis, enquanto avaliações baseadas em referência mostraram desempenho comparativamente melhor. Esses resultados destacam a natureza não confiável dos atuais LLMs Avaliadores e defendem uma implementação cautelosa em aplicações práticas. O código e os dados estão disponíveis em https://github.com/AI4Bharat/FBI.
Doddapaneni et al. (Quarta,) estudaram esta questão.