Los puntos clave no están disponibles para este artículo en este momento.
Realizamos una exploración en profundidad de diferentes estrategias para la detección de eventos en videos utilizando redes neuronales convolucionales (CNN) entrenadas para la clasificación de imágenes. Estudiamos diferentes maneras de realizar agrupamiento espacial y temporal, normalización de características, elección de capas de CNN, así como la elección de clasificadores. Hacer elecciones juiciosas en estas dimensiones llevó a un aumento muy significativo en el rendimiento en comparación con enfoques más ingenuos que se han utilizado hasta ahora. Evaluamos nuestro enfoque en el desafiante conjunto de datos TRECVID MED'14 con dos arquitecturas CNN populares preentrenadas en ImageNet. En este conjunto de datos MED'14, nuestros métodos, basados completamente en características de CNN entrenadas con imágenes, pueden superar varios modelos no CNN de última generación. Nuestra fusión tardía de características basadas en CNN y en movimiento puede aumentar aún más la precisión media promedio (mAP) en MED'14 del 34.95% al 38.74%. El enfoque de fusión logra el rendimiento de clasificación de última generación en el desafiante conjunto de datos UCF-101.
Zha et al. (Vier,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: