Key points are not available for this paper at this time.
Reivindicações recentes sobre as impressionantes habilidades de grandes modelos de linguagem (LLMs) são frequentemente apoiadas pela avaliação de benchmarks disponíveis publicamente. Uma vez que os LLMs treinam em amplas partes da internet, essa prática levanta preocupações sobre a contaminação de dados, ou seja, avaliar em exemplos que estão explicitamente ou implicitamente incluídos nos dados de treinamento. A contaminação de dados continua sendo notoriamente difícil de medir e mitigar, mesmo com tentativas parciais, como experimentação controlada de dados de treinamento, strings canário ou semelhanças de incorporação. Neste trabalho, realizamos a primeira análise longitudinal minuciosa da contaminação de dados em LLMs, usando o experimento natural dos cortes de treinamento em modelos GPT para observar benchmarks lançados ao longo do tempo. Especificamente, consideramos dois conjuntos de dados de resolução de problemas de código/matemática, Codeforces e Project Euler, e encontramos tendências estatisticamente significativas entre a taxa de sucesso de LLM vs. popularidade do GitHub e data de lançamento que fornecem fortes evidências de contaminação. Ao disponibilizar nosso conjunto de dados, resultados brutos e estrutura de avaliação, nosso trabalho abre caminho para análises rigorosas de contaminação de dados em modelos modernos. Concluímos com uma discussão sobre melhores práticas e próximos passos para a liberação pública de benchmarks na era dos LLMs que treinam em dados de escala web.
Roberts et al. (Mon,) estudaram essa questão.