Key points are not available for this paper at this time.
A reidentificação de pessoas despertou muito interesse devido à sua importância na vigilância de vídeo inteligente. É uma tarefa difícil devido à presença de desafios críticos como mudanças na aparência, desalinhamento, oclusão e ruído de fundo. A camada de drop block em lote (BDB) tem sido utilizada recentemente na reidentificação de pessoas, explorando o procedimento de apagamento de características. No entanto, o BDB descarta um bloco de características de forma aleatória, resultando na perda de informações contextuais, o que torna o modelo difícil de treinar. Além disso, devido à eliminação aleatória de características, uma grande área de informações discriminativas pode ser perdida durante o treinamento, resultando em baixa eficiência e desempenho. Para resolver esse problema e melhorar o poder de representação do modelo, propomos um módulo de atenção com gargalo leve e autodaptativo, com um ramo de autoatenção para melhorar o desempenho do modelo, reduzindo a sobrecarga de parâmetros com custo computacional negligenciável. A abordagem proposta envolve o módulo de atenção com gargalo (BAM), que é incorporado entre as camadas do ResNet para remover o ruído de fundo e nomear a parte semântica de alto nível. Além disso, convoluções dilatadas com normalização em lote são usadas para lidar com o problema de perda de informações contextuais e evitar sobreajuste. Adicionalmente, um ramo global informativo é utilizado, que captura a representação global da rede, e o ramo de atenção envolve as informações salientes locais em múltiplas escalas. Dois tipos de funções de perda, incluindo softmax e triplet hard em lote, são usados no processo de treinamento para cada ramo, forçando a rede a encapsular o atributo comum dentro da identidade similar e a manter distância entre indivíduos distintos. Comparado com BDB, nossa rede melhora o mAp para 88,1%, e o Rank-1 atinge 96,3% para o conjunto de dados market-1501. Os resultados no conjunto de dados Cuhk-03-Detected mostraram uma pontuação mAp de 79,2%, com 81,4% de Rank-1, enquanto no conjunto de dados Cuhk-03-labelled, uma pontuação mAP de 81,3% e uma pontuação de Rank-1 de 83,3% foi alcançada. Experimentos revelam que o modelo ResNet com a adição de múltiplas camadas BAM apresenta desempenho consistente sobre os conjuntos de dados de estado da arte usando perda softmax e triplet hard em lote.
Yaseen et al. (Sat,) estudaram esta questão.