Los puntos clave no están disponibles para este artículo en este momento.
Resumen Los modelos de transformadores están evolucionando rápidamente en tareas estándar de procesamiento de lenguaje natural; sin embargo, su aplicación está proliferando drásticamente también en la visión por computadora (CV). Los transformadores están reemplazando redes convolucionales o se están utilizando en conjunto con ellas. Este artículo tiene como objetivo diferenciar el diseño de modelos construidos con redes neuronales convolucionales (CNN) y modelos basados en transformadores, particularmente en el ámbito de la detección de objetos. Las CNN están diseñadas para capturar patrones espaciales locales a través de capas convolucionales, lo cual es adecuado para tareas que implican comprender jerarquías y características visuales. Sin embargo, los transformadores traen un nuevo paradigma a la CV al aprovechar mecanismos de atención propia, lo que permite captar tanto el contexto local como el global en las imágenes. Aquí, abordamos diversos aspectos como el nivel básico de comprensión, estudio comparativo, aplicación del modelo de atención, y resaltamos el tremendo crecimiento junto con la entrega de eficiencia que se presentan de manera efectiva para la tarea de detección de objetos. El principal énfasis de este trabajo es ofrecer una comprensión básica de las arquitecturas para la tarea de detección de objetos y motivar la adopción de las mismas en tareas de visión por computadora. Además, este artículo destaca la evolución de los modelos basados en transformadores en la detección de objetos y su creciente importancia en el campo de la visión por computadora, también identificamos la dirección de investigación abierta en el mismo campo.
Shah et al. (Mon,) estudiaron esta cuestión.