Key points are not available for this paper at this time.
A detecção de faces é crucial no desenvolvimento de reconhecimento facial, expressão, rastreamento e classificação. Métodos convencionais apresentam restrições de precisão em várias condições desafiadoras, incluindo rostos não frontais, oclusões e fundos complexos. No entanto, os métodos de rede neural convolucional (CNN) apresentam alto desempenho, apesar da grande quantidade de computação necessária. Portanto, a CNN requer hardware caro e não é adequada para unidades centrais de processamento (CPUs) de baixo custo. Este artigo desenvolve uma arquitetura leve para um detector de faces em tempo real baseado em CNN. A arquitetura proposta consiste em dois módulos principais, a espinha dorsal para extrair características faciais distintas e a detecção em múltiplos níveis para realizar previsões em múltiplas escalas. Além disso, utiliza várias abordagens para melhorar o resultado do treinamento, incluindo balanceamento de perdas e ajustes na configuração de treinamento. O detector proposto tem uma única etapa e é treinado usando a entrada de imagens do WIDER FACE com desafios, que contém imagens mais desafiadoras do que outros conjuntos de dados. Como resultado, o detector alcança desempenho de ponta em vários conjuntos de dados de referência em comparação com outros modelos baseados em CPU. Então, sua eficiência é superior à dos concorrentes, já que roda a 53 quadros por segundo em uma CPU para imagens de resolução de vídeo gráfico.
Putro et al. (Mon,) estudaram essa questão.