Key points are not available for this paper at this time.
O alinhamento de entidades multi-modais (MMEA) visa identificar entidades equivalentes entre grafos de conhecimento multi-modais (MMKGs), onde as entidades podem estar associadas a imagens relacionadas. A maioria dos estudos existentes integra informações multi-modais dependendo fortemente do módulo de fusão aprendido automaticamente, raramente suprimindo a informação redundante para MMEA de forma explícita. Para isso, exploramos o gargalo de informação variacional para alinhamento de entidades multi-modais (IBMEA), que enfatiza a informação relevante ao alinhamento e suprime a informação irrelevante ao alinhamento na geração de representações de entidades. Especificamente, desenvolvemos codificadores variacionais multi-modais para gerar representações de entidades específicas de modal como distribuições de probabilidade. Em seguida, propomos quatro regularizadores de gargalo de informação específicos de modal, limitando as pistas enganosas no refino das representações de entidades específicas de modal. Por fim, propomos um regularizador contrastivo de informação híbrida de modal para integrar todas as representações refinadas específicas de modal, aprimorando a similaridade das entidades entre MMKGs para alcançar MMEA. Realizamos experimentos extensivos em dois conjuntos de dados de MMEA cross-KG e três conjuntos de dados bilíngues. Os resultados experimentais demonstram que nosso modelo consistentemente supera métodos anteriores de estado da arte, e também demonstra desempenho promissor e robusto em cenários de dados com baixa disponibilidade de recursos e alto ruído.
Su et al. (Sat,) estudaram esta questão.