Los puntos clave no están disponibles para este artículo en este momento.
Se espera que la búsqueda de arquitecturas neuronales (Neural Architecture Search, NAS), cuyo objetivo es el diseño automático de arquitecturas de red mediante máquinas, dé lugar a una nueva revolución en el aprendizaje automático. A pesar de estas altas expectativas, la eficacia y la eficiencia de las soluciones de NAS existentes no están claras, y algunos trabajos recientes llegan a sugerir que muchas de las soluciones de NAS actuales no son mejores que una selección aleatoria de arquitecturas. La ineficacia de las soluciones de NAS puede atribuirse a una evaluación inexacta de las arquitecturas. Específicamente, para acelerar la NAS, trabajos recientes han propuesto subentrenar diferentes arquitecturas candidatas en un gran espacio de búsqueda de forma concurrente utilizando parámetros de red compartidos; sin embargo, esto ha resultado en calificaciones incorrectas de las arquitecturas y ha profundizado la ineficacia de la NAS. En este trabajo, proponemos modularizar el amplio espacio de búsqueda de NAS en bloques para garantizar que las posibles arquitecturas candidatas estén completamente entrenadas; esto reduce el desplazamiento de la representación causado por los parámetros compartidos y conduce a una calificación correcta de las candidatas. Gracias a la búsqueda por bloques, también podemos evaluar todas las arquitecturas candidatas dentro de cada bloque. Además, encontramos que el conocimiento de un modelo de red reside no solo en los parámetros de la red, sino también en la arquitectura de la red. Por lo tanto, proponemos destilar el conocimiento de la arquitectura neuronal (DNA) de un modelo maestro para supervisar nuestra búsqueda de arquitecturas por bloques, lo que mejora significativamente la eficacia de NAS. Cabe destacar que el rendimiento de nuestras arquitecturas encontradas ha superado al modelo maestro, demostrando la viabilidad práctica de nuestro método. Por último, nuestro método alcanza una precisión top-1 de vanguardia del 78.4% en ImageNet en un entorno móvil. Todos nuestros modelos obtenidos, junto con el código de evaluación, están disponibles en https://github.com/changlin31/DNA.
Li et al. (Mon,) estudiaron esta cuestión.