Key points are not available for this paper at this time.
La stratégie de quantification non uniforme pour compresser les réseaux neuronaux réalise généralement de meilleures performances que sa compatriote, c'est-à-dire la stratégie uniforme, grâce à sa capacité représentationnelle supérieure. Cependant, de nombreuses méthodes de quantification non uniforme négligent le processus de projection compliqué lors de l'implémentation des poids/activations quantifiés non uniformément, ce qui entraîne des surcoûts en temps et en espace non négligeables dans le déploiement matériel. Dans cette étude, nous proposons la Quantification Non Uniforme à Uniforme (N2UQ), une méthode qui peut maintenir la forte capacité de représentation des méthodes non uniformes tout en étant conviviale et efficace pour le matériel, comme la quantification uniforme pour l'inférence de modèle. Nous y parvenons en apprenant les seuils d'entrée flexibles inéquidistants pour mieux s'adapter à la distribution sous-jacente tout en quantifiant ces entrées à valeurs réelles en niveaux de sortie équidistants. Pour entraîner le réseau quantifié avec des seuils d'entrée apprenables, nous introduisons un estimateur généralisé de passage direct (G-STE) pour le calcul de dérivée arrière difficile par rapport aux paramètres de seuil. De plus, nous considérons une régularisation préservant l'entropie pour réduire davantage la perte d'information dans la quantification des poids. Même sous cette contrainte défavorable d'imposer des poids et des activations quantifiés uniformément, notre N2UQ surpasse les méthodes de quantification non uniforme à la pointe de la technologie de 0,5 à 1,7 % sur ImageNet, démontrant la contribution de la conception N2UQ. Le code et les modèles sont disponibles à : https://github.com/liuzechun/Nonuniform-to-Uniform-Quantization.
Liu et al. (Mercredi,) ont étudié cette question.