Los puntos clave no están disponibles para este artículo en este momento.
Este artículo estudia la segmentación panóptica, una tarea propuesta recientemente que segmenta objetos de primer plano (FG) a nivel de instancia así como contenidos de fondo (BG) a nivel semántico. Los métodos existentes han tratado en su mayoría estos dos problemas por separado, pero en este artículo, revelamos la relación subyacente entre ellos, en particular, los objetos FG proporcionan señales complementarias para asistir en la comprensión del BG. Nuestro enfoque, llamado Red Unificada Guiada por Atención (AUNet), es un marco unificado con dos ramas para la segmentación de FG y BG simultáneamente. Dos fuentes de atención se añaden a la rama de BG, a saber, RPN y máscara de segmentación de FG para proporcionar atenciones a nivel de objeto y a nivel de píxel, respectivamente. Nuestro enfoque se generaliza a diferentes estructuras con un aumento de precisión consistente tanto en la segmentación de FG como de BG, y también establece nuevos récords de estado del arte tanto en los benchmarks de MS-COCO (46.5% PQ) como en Cityscapes (59.0% PQ).
Li et al. (Sat,) estudiaron esta cuestión.