Key points are not available for this paper at this time.
Les techniques de compression de modèle sur les réseaux de neurones profonds (DNN) ont été largement reconnues comme une méthode efficace pour atteindre l'accélération sur une variété de plateformes, et l'élagage des poids DNN est une méthode simple et efficace. Il existe actuellement deux courants principaux d'élagage représentant deux extrêmes de la régularité de l'élagage : l'élagage non structuré et fin peut atteindre une haute rareté et précision, mais n'est pas compatible avec le matériel ; l'élagage structuré et grossier exploite des structures efficaces en matière de matériel pour l'élagage, mais souffre d'une perte de précision lorsque le taux d'élagage est élevé. Dans cet article, nous introduisons PCONV, comprenant une nouvelle dimension de rareté, – des motifs d'élagage fin à l'intérieur des structures grossières. PCONV comprend deux types de raretés, les motifs de convolution sparse (SCP) qui sont générés à partir de l'élagage de noyaux intra-convolution et la rareté de connectivité générée par l'élagage de noyaux inter-convolution. En substance, SCP améliore la précision en raison de ses propriétés visuelles spéciales, et la rareté de connectivité augmente le taux d'élagage tout en maintenant une charge de travail équilibrée sur le calcul des filtres. Pour déployer PCONV, nous développons un nouveau cadre d'inférence DNN assisté par un compilateur et exécutons des modèles PCONV en temps réel sans compromis sur la précision, ce qui ne peut pas être réalisé dans les travaux antérieurs. Nos résultats expérimentaux montrent que PCONV surpasse trois cadres DNN de bout en bout à la pointe de la technologie, TensorFlow-Lite, TVM et Alibaba Mobile Neural Network avec des accélérations allant jusqu'à 39,2 ×, 11,4 × et 6,3 ×, respectivement, sans perte de précision. Les appareils mobiles peuvent atteindre une inférence en temps réel sur des DNN à grande échelle.
Ma et al. (ven,) ont étudié cette question.