Key points are not available for this paper at this time.
Un composant central présent dans de nombreuses architectures de réseaux neuronaux réussies est un bloc MLP composé de deux couches entièrement connectées avec une activation non linéaire entre elles. Un phénomène intrigant observé empiriquement, y compris dans les architectures transformer, est qu'après l'entraînement, les activations de la couche cachée de ce bloc MLP ont tendance à être extrêmement rares pour une entrée donnée. Contrairement aux formes traditionnelles de sparsité, où il existe des neurones/poids qui peuvent être supprimés du réseau, cette forme de sparsité d'activation dynamique semble plus difficile à exploiter pour obtenir des réseaux plus efficaces. Motivés par cela, nous entamons une étude formelle de l'apprentissage PAC des couches MLP qui présentent une sparsité d'activation. Nous présentons une variété de résultats montrant que de telles classes de fonctions entraînent des avantages computationnels et statistiques prouvables par rapport à leurs homologues non spars. Notre espoir est qu'une meilleure compréhension théorique des réseaux activés de manière sparse conduira à des méthodes capables d'exploiter la sparsité d'activation dans la pratique.
Awasthi et al. (Mar,) ont étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: