Los puntos clave no están disponibles para este artículo en este momento.
Las innovaciones recientes en el entrenamiento de modelos de redes neuronales convolucionales profundas (ConvNet) han motivado el diseño de nuevos métodos para aprender automáticamente descriptores de imagen locales. Los últimos ConvNets profundos propuestos para esta tarea consisten en una red siamés que se entrena penalizando la clasificación incorrecta de pares de parches de imagen locales. Los resultados actuales de aprendizaje automático muestran que reemplazar este siamés por una red de tripletas puede mejorar la precisión de clasificación en varios problemas, pero esto aún no se ha demostrado para el aprendizaje de descriptores de imagen locales. Además, las actuales redes siamés y de tripletas han sido entrenadas con descenso de gradiente estocástico que calcula el gradiente a partir de pares individuales o tripletas de parches de imagen locales, lo que puede hacer que sean propensas al sobreajuste. En este artículo, primero proponemos el uso de redes de tripleta para el problema del aprendizaje de descriptores de imagen locales. Además, también proponemos el uso de una pérdida global que minimiza el error de clasificación general en el conjunto de entrenamiento, lo que puede mejorar la capacidad de generalización del modelo. Usando el conjunto de datos de referencia de UBC para comparar descriptores de imagen locales, mostramos que la red de tripleta produce una incrustación más precisa que la red siamés en términos de los errores del conjunto de datos de UBC. Además, también demostramos que una combinación de las pérdidas de tripleta y global produce la mejor incrustación en el campo, utilizando esta red de tripleta. Finalmente, también mostramos que el uso de la red siamés central-surround entrenada con la pérdida global produce el mejor resultado del campo en el conjunto de datos de UBC.
Kumar et al. (Wed,) estudiaron esta cuestión.