Key points are not available for this paper at this time.
Informações visuais mostraram capacitar o reconhecimento preciso de entidades nomeadas em textos curtos, como postagens em redes sociais. Trabalhos anteriores sobre reconhecimento de entidades nomeadas multimodal (MNER) frequentemente consideram uma imagem como um conjunto de objetos visuais, tentando alinhar explicitamente objetos visuais e entidades. No entanto, esses métodos podem sofrer o viés introduzido por objetos visuais quando não são idênticos a entidades em quantidade e tipo de entidade. Diferente desse tipo de alinhamento explícito, argumentamos que o alinhamento implícito é eficaz na otimização do aprendizado de espaço semântico compartilhado entre texto e imagem para melhorar o MNER. Para isso, propomos uma abordagem baseada em aprendizado contrastivo de desvio para MNER, que estuda o alinhamento de modalidade aprimorado por aprendizado contrastivo cross-modal. Especificamente, nosso aprendizado contrastivo adota uma estratégia de-mineração de amostras difíceis e uma perda contrastiva desvirtuada para aliviar o viés de quantidade e tipo de entidade, respectivamente, que aprende globalmente a alinhar os espaços de características de texto e imagem. Finalmente, o espaço semântico aprendido trabalha com um decodificador NER para reconhecer entidades em texto. Realizados em dois conjuntos de dados de benchmark, resultados experimentais mostram que nossa abordagem supera os métodos de estado da arte atuais.
Zhang et al. (Quarta-feira,) estudaram essa questão.