Key points are not available for this paper at this time.
Bild-Text-Abgleich ist eine wichtige cross-modale Aufgabe in der künstlichen Intelligenz und hat in den letzten Jahren zunehmende Aufmerksamkeit erhalten. Bestehende Arbeiten haben gezeigt, dass das Erlernen semantischer Konzepte nützlich ist, um die Bildrepräsentation zu verbessern und die Leistung sowohl bei Bild-zu-Text- als auch bei Text-zu-Bild-Retrieval signifikant steigern kann. Allerdings erkennen existierende Modelle semantische Konzepte lediglich aus einem gegebenen Bild, was weniger effektiv ist, um Langschwanz- und Verdeckungs-Konzepte zu behandeln. Häufig gemeinsam vorkommende Konzepte in derselben Szene, z. B. Schlafzimmer und Bett, können Allgemeinwissens-Kenntnisse bereitstellen, um weitere semantisch verwandte Konzepte zu entdecken. In dieser Arbeit entwickeln wir einen Scene Concept Graph (SCG), indem wir Bild-Szenengraphen aggregieren und häufig gemeinsam auftretende Konzeptpaare als szenenspezifisches Allgemeinwissen extrahieren. Außerdem schlagen wir ein neuartiges Modell vor, das dieses Wissen integriert, um den Bild-Text-Abgleich zu verbessern. Konkret werden semantische Konzepte aus Bildern erkannt und anschließend durch den SCG erweitert. Nach dem Erlernen der Auswahl relevanter kontextueller Konzepte fusionieren wir deren Repräsentationen mit dem Bild-Embedding-Feature, um sie dem Abgleichsmodul zuzuführen. Umfangreiche Experimente auf den Datensätzen Flickr30K und MSCOCO belegen, dass unser Modell durch die effektive Einbindung des externen SCG state-of-the-art Ergebnisse erzielt.
Shi et al. (Sun,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: