Los puntos clave no están disponibles para este artículo en este momento.
Para que el aprendizaje automático sea confiable en muchas aplicaciones, es fundamental poder explicar de manera confiable por qué el algoritmo de aprendizaje automático hace ciertas predicciones. Por esta razón, recientemente se han desarrollado una variedad de métodos para interpretar las predicciones de las redes neuronales proporcionando, por ejemplo, mapas de importancia de características. Tanto por razones de robustez científica como de seguridad, es importante saber en qué medida las interpretaciones pueden ser alteradas por pequeñas perturbaciones sistemáticas a los datos de entrada, que pueden ser generadas por adversarios o por sesgos de medición. En este artículo, demostramos cómo generar perturbaciones adversarias que producen entradas perceptivamente indistinguibles que se les asigna la misma etiqueta predicha, pero que tienen interpretaciones muy diferentes. Caracterizamos sistemáticamente la robustez de las interpretaciones generadas por varios métodos de interpretación de importancia de características ampliamente utilizados (mapas de importancia de características, gradientes integrados y DeepLIFT) en ImageNet y CIFAR-10. En todos los casos, nuestros experimentos muestran que las perturbaciones sistemáticas pueden llevar a interpretaciones dramáticamente diferentes sin cambiar la etiqueta. Extendemos estos resultados para mostrar que las interpretaciones basadas en ejemplares (por ejemplo, funciones de influencia) son igualmente susceptibles a ataques adversarios. Nuestro análisis de la geometría de la matriz Hessiana proporciona información sobre por qué la robustez es un desafío general para los enfoques de interpretación actuales.
Ghorbani et al. (Mié,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: