Key points are not available for this paper at this time.
Faces no mundo real são geralmente capturadas em várias poses, iluminações e oclusões, e assim, inerentemente distribuídas multimodalmente em muitas tarefas. Propomos uma Rede Neural Convolucional Condicional, chamada de c-CNN, para lidar com o reconhecimento facial multimodal. Diferente da CNN tradicional que adota núcleos de convolução fixos, as amostras em c-CNN são processadas com conjuntos de núcleos ativados dinamicamente. Em particular, os núcleos de convolução dentro de cada camada são ativados de forma esparsa somente quando uma amostra é passada pela rede. Para uma amostra dada, as ativações dos núcleos de convolução em uma certa camada são condicionadas à sua representação intermediária atual e ao status de ativação nas camadas inferiores. Os núcleos ativados através das camadas definem as rotas adaptativas específicas da amostra que revelam a distribuição das modalidades subjacentes. Consequentemente, a estrutura proposta não depende de nenhum conhecimento prévio sobre as modalidades, em contraste com a maioria dos métodos existentes. Para substanciar a estrutura genérica, apresentamos um caso especial de c-CNN através da incorporação do roteamento condicional da árvore de decisão, que é avaliado com dois problemas de multimodalidade - identificação de faces em múltiplos ângulos e verificação de faces ocluídas. Extensos experimentos demonstram melhorias consistentes em relação aos métodos que não têm consciência das modalidades.
Xiong et al. (Terça,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: