Key points are not available for this paper at this time.
Le succès des récents réseaux de neurones convolutionnels profonds (CNN) dépend de l'apprentissage de représentations cachées qui peuvent résumer les facteurs importants de variation derrière les données. Dans ce travail, nous décrivons la dissection de réseau, une méthode qui interprète les réseaux en fournissant des étiquettes significatives à leurs unités individuelles. La méthode proposée quantifie l'interprétabilité des représentations des CNN en évaluant l'alignement entre les unités cachées individuelles et les concepts sémantiques visuels. En identifiant les meilleurs alignements, des étiquettes interprétables sont attribuées aux unités, allant des couleurs, matériaux, textures, parties, objets et scènes. La méthode révèle que les représentations profondes sont plus transparentes et interprétables qu'elles ne le seraient sous une base aléatoire d'équivalent puissant. Nous appliquons notre approche pour interpréter et comparer les représentations latentes de plusieurs architectures de réseaux entraînées pour résoudre un large éventail de tâches supervisées et auto-supervisées. Nous examinons ensuite les facteurs affectant l'interprétabilité du réseau, tels que le nombre d'itérations d'entraînement, les régularisations, les différents paramètres d'initialisation, ainsi que la profondeur et la largeur des réseaux. Enfin, nous montrons que les unités interprétées peuvent être utilisées pour fournir des explications explicites d'une prédiction de CNN donnée pour une image. Nos résultats soulignent que l'interprétabilité est une propriété importante des réseaux de neurones profonds qui offrent de nouvelles perspectives sur ce que les structures hiérarchiques peuvent apprendre.
Zhou et al. (Mon,) ont étudié cette question.