Key points are not available for this paper at this time.
Redes neurais profundas (DNNs) de última geração possuem centenas de milhões de conexões e são intensivas em computação e memória, tornando-as difíceis de implementar em sistemas embarcados com recursos de hardware limitados e orçamentos de energia. Embora o hardware personalizado ajude na computação, a obtenção de pesos da DRAM é duas ordens de magnitude mais cara do que operações de ALU e domina a potência requerida. A 'Compressão Profunda' proposta anteriormente torna possível acomodar grandes DNNs (AlexNet e VGGNet) completamente na SRAM on-chip. Essa compressão é alcançada pela poda das conexões redundantes e pela compartilhamento de peso entre múltiplas conexões. Propomos um motor de inferência eficiente em energia (EIE) que realiza inferências neste modelo de rede comprimido e acelera a multiplicação de matrizes esparsas resultantes com compartilhamento de peso. A transição da DRAM para SRAM proporciona uma economia de energia de 120×; a exploração da esparsidade economiza 10×; o compartilhamento de peso fornece 8×; pular ativações nulas do ReLU economiza mais 3×. Avaliado em nove benchmarks de DNN, o EIE é 189× e 13× mais rápido em comparação com as implementações de CPU e GPU do mesmo DNN sem compressão. O EIE tem um poder de processamento de 102 GOPS operando diretamente em uma rede comprimida, correspondente a 3 TOPS em uma rede não comprimida, e processa camadas FC de AlexNet a 1,88×10⁴ quadros/seg com uma dissipação de potência de apenas 600mW. É 24.000× e 3.400× mais eficiente em energia do que uma CPU e uma GPU, respectivamente. Comparado ao DaDianNao, o EIE tem um desempenho 2,9×, 19× e 3× melhor em taxa de transferência, eficiência energética e eficiência de área.
Han et al. (Sat,) estudaram esta questão.