Modelos de Linguagem Grande (LLMs) avançaram significativamente os estudos de verificação de fatos. No entanto, os métodos existentes de avaliação automatizada de verificação de fatos dependem de conjuntos de dados estáticos e métricas de classificação, que não conseguem avaliar automaticamente a produção de justificativas e descobrir as limitações sutis dos LLMs na verificação de fatos. Neste trabalho, introduzimos o FACT-AUDIT, uma estrutura impulsionada por agentes que avalia de maneira adaptativa e dinâmica as capacidades de verificação de fatos dos LLMs. Aproveitando princípios de amostragem de importância e colaboração entre múltiplos agentes, o FACT-AUDIT gera conjuntos de dados adaptativos e escaláveis, realiza avaliações iterativas centradas no modelo e atualiza as avaliações com base nas respostas específicas de cada modelo. Ao incorporar a produção de justificativas junto com a previsão de veredictos, esta estrutura fornece uma auditoria abrangente e em evolução das capacidades de raciocínio factual dos LLMs, para investigar sua confiabilidade. Experimentos extensos demonstram que o FACT-AUDIT diferencia efetivamente entre LLMs de última geração, fornecendo insights valiosos sobre os pontos fortes e limitações do modelo na análise de verificação de fatos centrada no modelo.
Lin et al. (Ter,) estudaram esta questão.