Key points are not available for this paper at this time.
Modelos de linguagem grandes podem memorizar e repetir seus dados de treinamento, causando riscos de privacidade e direitos autorais. Para mitigar a memorização, introduzimos uma modificação sutil no objetivo de treinamento do próximo token que chamamos de perda de peixe dourado. Durante o treinamento, um subconjunto de tokens amostrados aleatoriamente é excluído do cálculo da perda. Esses tokens eliminados não são memorizados pelo modelo, o que previne a reprodução literal de uma cadeia completa de tokens do conjunto de treinamento. Realizamos extensos experimentos treinando modelos Llama-2 em escala de bilhões, tanto pré-treinados quanto treinados do zero, e demonstramos reduções significativas na memorização extraível com pouco ou nenhum impacto em benchmarks posteriores.
Hans et al. (Sex,) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: