Los puntos clave no están disponibles para este artículo en este momento.
La mayoría de los métodos de destilación de conocimiento basados en logit transfieren etiquetas suaves del modelo docente al modelo estudiantil a través de la divergencia de Kullback–Leibler basada en softmax, una función de normalización exponencial. Sin embargo, esta naturaleza exponencial de softmax tiende a priorizar la clase más grande (clase objetivo) mientras descuida las más pequeñas (clases no objetivo), lo que lleva a pasar por alto la importancia de las clases no objetivo. Para abordar este problema, proponemos la Destilación de Conocimiento Mejorada por Clases No Objetivo (NTCE-KD) para amplificar el papel de las clases no objetivo tanto en términos de magnitud como de diversidad. Específicamente, presentamos una divergencia de Kullback–Leibler (MKL) mejorada en magnitud, reduciendo la clase objetivo para aumentar el impacto de las clases no objetivo en términos de magnitud. Además, para enriquecer la diversidad de las clases no objetivo, introducimos una estrategia de aumento de datos basada en diversidad (DDA), mejorando aún más el rendimiento general. Resultados experimentales extensos en los conjuntos de datos CIFAR-100 e ImageNet-1k demuestran que las clases no objetivo son de gran importancia y que nuestro método logra un rendimiento de vanguardia en una amplia gama de pares docente-estudiante.
Li et al. (Mon,) estudiaron esta cuestión.