Los puntos clave no están disponibles para este artículo en este momento.
Las Redes Neuronales Convolucionales (CNN) han demostrado ser muy efectivas en la clasificación de imágenes y muestran promesas para el audio. Usamos varias arquitecturas de CNN para clasificar las bandas sonoras de un conjunto de datos de 70 millones de videos de entrenamiento (5.24 millones de horas) con 30,871 etiquetas a nivel de video. Examinamos Redes Neuronales Profundas (DNN) totalmente conectadas, AlexNet 1, VGG 2, Inception 3 y ResNet 4. Investigamos variar el tamaño tanto del conjunto de entrenamiento como del vocabulario de etiquetas, encontrando que los análogos de las CNN utilizadas en la clasificación de imágenes funcionan bien en nuestra tarea de clasificación de audio, y que conjuntos de entrenamiento y etiquetas más grandes ayudan hasta cierto punto. Un modelo que utiliza embeddings de estos clasificadores funciona mucho mejor que características crudas en la tarea de clasificación de Detección de Eventos Acústicos (AED) del Audio Set 5.
Hershey et al. (2017) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: