Key points are not available for this paper at this time.
Strukturiertes Gewicht-Pruning ist eine repräsentative Modellkompressionstechnik von DNNs, um die Speicher- und Berechnungsanforderungen zu reduzieren und die Inferenz zu beschleunigen. Ein automatischer Prozess zur Bestimmung der Hyperparameter ist aufgrund der großen Anzahl flexibler Hyperparameter notwendig. Diese Arbeit schlägt AutoCompress vor, ein automatisches strukturiertes Pruning-Rahmenwerk mit den folgenden Schlüsselverbesserungen in der Leistung: (i) effektive Einbeziehung der Kombination von strukturierten Pruning-Schemata im automatischen Prozess; (ii) Übernahme des modernsten ADMM-basierten strukturierten Gewicht-Prunings als Kernalgorithmus und Vorschlag eines innovativen zusätzlichen Reinigungsprozesses zur weiteren Gewichtsreduktion ohne Verlust der Genauigkeit; und (iii) Entwicklung einer effektiven heuristischen Suchmethode, die durch erfahrungsbasierte geführte Suche verbessert wird, und damit die vorherige Technik des tiefen Verstärkungslernens ersetzt, die eine nicht zugrunde liegende Inkompatibilität mit dem Ziel-Pruning-Problem aufwies. Umfangreiche Experimente mit den CIFAR-10- und ImageNet-Datensätzen zeigen, dass AutoCompress der Schlüssel zur Erreichung ultrahoher Pruning-Raten bei der Anzahl der Gewichte und FLOPs ist, die zuvor nicht erreicht werden konnten. Als Beispiel übertrifft AutoCompress die vorherige Arbeit zur automatischen Modellkompression um bis zu 33× in der Pruning-Rate (120× Reduktion der tatsächlichen Parameterzahl) bei gleicher Genauigkeit. Eine signifikante Beschleunigung der Inferenz wurde vom AutoCompress-Rahmenwerk bei tatsächlichen Messungen auf Smartphones beobachtet. Wir veröffentlichen Modelle dieser Arbeit unter folgendem anonymen Link: http://bit.ly/2VZ63dS.
Liu et al. (Fri,) haben diese Frage untersucht.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: