Los puntos clave no están disponibles para este artículo en este momento.
Describimos el conjunto de datos de videos de acción humana Kinetics de DeepMind. El conjunto de datos contiene 400 clases de acción humana, con al menos 400 clips de video para cada acción. Cada clip dura alrededor de 10 segundos y se toma de un video diferente de YouTube. Las acciones se centran en los humanos y abarcan una amplia gama de clases, incluyendo interacciones humano-objeto como tocar instrumentos, así como interacciones humano-humano como dar la mano. Describimos las estadísticas del conjunto de datos, cómo fue recolectado y proporcionamos algunas cifras de rendimiento base para arquitecturas de redes neuronales entrenadas y probadas para la clasificación de acciones humanas en este conjunto de datos. También llevamos a cabo un análisis preliminar de si el desbalance en el conjunto de datos conduce a sesgos en los clasificadores.
Zisserman et al. (Vie,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: