Key points are not available for this paper at this time.
Neste artigo, revisamos resultados recentes sobre fusão audiovisual (AV). Também discutimos alguns dos desafios e relatamos abordagens para enfrentá-los. Uma questão importante na fusão AV é como as modalidades interagem e se influenciam mutuamente. Esta revisão abordará essa questão no contexto do processamento de fala AV, e especialmente no reconhecimento de fala, onde um dos problemas é que as modalidades interagem, mas também às vezes parecem se desincronizar uma da outra. Um problema adicional que às vezes surge é que uma das modalidades pode estar ausente no momento do teste, embora esteja disponível no momento do treinamento; por exemplo, pode ser possível coletar dados de treinamento AV enquanto se tem acesso apenas ao áudio no momento do teste. Revisaremos abordagens para abordar essa questão na área de aprendizado multiview, onde o objetivo é aprender um modelo ou representação para cada uma das modalidades separadamente, aproveitando os ricos dados de treinamento multimodal. Além do aprendizado multiview, também discutimos a aplicação recente de aprendizagem profunda (DL) na fusão AV. Por fim, tiramos conclusões e oferecemos nossa avaliação sobre o futuro na área de fusão AV.
Katsaggelos et al. (Sex,) estudaram esta questão.