Los puntos clave no están disponibles para este artículo en este momento.
La comprensión de la visión y el lenguaje es uno de los problemas más fundamentales y desafiantes en la Inteligencia Multimedia. Comprender simultáneamente las acciones de video con una pregunta en lenguaje natural relacionada y producir una respuesta precisa es aún más desafiante, ya que requiere modelar conjuntamente la información a través de las modalidades. En los últimos años, algunos estudios han comenzado a abordar este problema utilizando redes neuronales profundas mejoradas por atención. Sin embargo, mecanismos de atención simples como la atención unidireccional no logran proporcionar un mejor mapeo entre diferentes modalidades. Además, ninguno de estos modelos de QA de video explora la semántica de alto nivel a nivel de fotogramas de video aumentados. En este artículo, aumentamos la representación de cada fotograma con su información de contexto mediante un nuevo extractor de características que combina las ventajas de Resnet y una variante de C3D. Además, proponemos una nueva red de atención alternante que puede atender alternativamente regiones del fotograma, fotogramas de video y palabras en la pregunta en múltiples turnos. Esto ofrece mejores representaciones conjuntas de video y pregunta, ayudando aún más al modelo profundo a descubrir la relación más profunda entre las dos modalidades. Nuestro método supera a los modelos de QA de video de última generación en dos conjuntos de datos existentes de respuesta a preguntas de video. Estudios de ablación adicionales demostraron que nuestro extractor de características y el mecanismo de atención alternante pueden mejorar el rendimiento conjuntamente.
Zhang et al. (Fri,) estudiaron esta cuestión.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: