Los puntos clave no están disponibles para este artículo en este momento.
Las técnicas de compresión de modelos en Redes Neuronales Profundas (DNN) han sido ampliamente reconocidas como una forma efectiva de lograr aceleración en una variedad de plataformas, y la poda de pesos de DNN es un método directo y efectivo. Actualmente hay dos corrientes principales de métodos de poda que representan dos extremos de regularidad de poda: la poda no estructurada y fina puede lograr alta escasez y precisión, pero no es amigable con el hardware; la poda estructurada y gruesa explota estructuras eficientes en hardware en la poda, pero sufre una caída en la precisión cuando la tasa de poda es alta. En este trabajo, introducimos PCONV, que comprende una nueva dimensión de escasez, - patrones de poda fina dentro de estructuras gruesas. PCONV comprende dos tipos de escasez, Patrones de Convolución Escasos (SCP) que se generan a partir de la poda de núcleos intra-convolutivos y escasez de conectividad generada a partir de la poda de núcleos inter-convolutivos. Esencialmente, SCP mejora la precisión debido a sus propiedades visuales especiales, y la escasez de conectividad aumenta la tasa de poda mientras mantiene una carga de trabajo equilibrada en la computación de filtros. Para implementar PCONV, desarrollamos un nuevo marco de inferencia DNN asistido por compilador y ejecutamos modelos PCONV en tiempo real sin comprometer la precisión, lo que no se puede lograr en trabajos anteriores. Nuestros resultados experimentales muestran que PCONV supera a tres marcos DNN de última generación, TensorFlow-Lite, TVM y Alibaba Mobile Neural Network con aceleraciones de hasta 39.2 ×, 11.4 × y 6.3 ×, respectivamente, sin pérdida de precisión. Los dispositivos móviles pueden lograr inferencia en tiempo real en DNN a gran escala.
Ma et al. (Vier,) estudiaron esta pregunta.