Los puntos clave no están disponibles para este artículo en este momento.
Los recientes paradigmas de agregación de características de vanguardia para la detección de objetos en video se basan en inferir la correspondencia de características. El problema de estimación de la correspondencia de características es fundamentalmente difícil debido a la mala calidad de imagen, el desenfoque por movimiento, etc., y los resultados de la estimación de la correspondencia de características son inestables. Para evitar el problema, proponemos un marco de agregación de características simple pero efectivo que opera a nivel de propuesta de objeto. Aprende a mejorar la característica de cada propuesta modelando relaciones semánticas y espacio-temporales entre las propuestas de objeto tanto dentro de un cuadro como entre cuadros adyacentes. Se llevan a cabo experimentos en el conjunto de datos ImageNet VID. Sin ningún adorno, nuestro método obtiene un 80.3\% mAP en el conjunto de datos ImageNet VID, que es superior al anterior estado del arte. El mecanismo de agregación de características propuesto mejora la línea base de Faster RCNN de un solo cuadro en un 5.8% mAP. Además, bajo la configuración de sin procesamiento posterior temporal, nuestro método supera el anterior estado del arte en un 1.4% mAP.
Luo et al. (Jue,) estudiaron esta cuestión.