L'abandon est une technique de régularisation largement utilisée dans l'entraînement des réseaux de neurones artificiels pour atténuer le surajustement. Elle consiste à désactiver dynamiquement des sous-ensembles du réseau pendant l'entraînement afin de promouvoir des représentations plus robustes. Malgré son adoption répandue, les taux d'abandon sont souvent sélectionnés de manière heuristique, et les explications théoriques de son succès restent rares. Ici, nous étudions analytiquement l'abandon dans des réseaux de neurones à deux couches entraînés avec une descente de gradient stochastique en ligne. Dans la limite haute dimensionnelle, nous dérivons un ensemble d'équations différentielles ordinaires qui caractérisent entièrement l'évolution du réseau pendant l'entraînement et capturent les effets de l'abandon. Nous obtenons un certain nombre de résultats exacts décrivant l'erreur de généralisation et la probabilité optimale d'abandon à court, moyen et long termes d'entraînement. Notre analyse montre que l'abandon réduit les corrélations nuisibles entre les noeuds cachés et atténue l'impact du bruit étiqueté, et que la probabilité optimale d'abandon augmente avec le niveau de bruit dans les données. Nos résultats sont validés par des simulations numériques étendues.
Mori et al. (Mercredi) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: