Key points are not available for this paper at this time.
Nous démontrons la possibilité de ce que nous appelons l'apprentissage épars : une formation accélérée de réseaux de neurones profonds qui maintiennent des poids épars tout au long de la formation tout en atteignant des niveaux de performance denses. Nous y parvenons en développant un moment épars, un algorithme qui utilise des gradients lissés exponentiellement (momentum) pour identifier les couches et les poids qui réduisent l'erreur de manière efficace. Le moment épars redistribue les poids élagués à travers les couches en fonction de l'amplitude moyenne du momentum de chaque couche. Au sein d'une couche, le moment épars augmente les poids en fonction de l'amplitude du momentum des poids à valeur nulle. Nous démontrons des performances éparses à la pointe de la technologie sur MNIST, CIFAR-10 et ImageNet, réduisant l'erreur moyenne de 8 %, 15 % et 6 % par rapport à d'autres algorithmes épars. De plus, nous montrons que le moment épars reproduit de manière fiable des niveaux de performance denses tout en offrant jusqu'à 5,61 fois une formation plus rapide. Dans notre analyse, les ablations montrent que les avantages de la redistribution et de la croissance du momentum augmentent avec la profondeur et la taille du réseau. De plus, nous constatons que le moment épars est insensible au choix de ses hyperparamètres, suggérant que le moment épars est robuste et facile à utiliser.
Dettmers et al. (Mercredi,) ont étudié cette question.