Key points are not available for this paper at this time.
Die Erkennung von Mensch-Objekt-Interaktionen (HOI) ist eine entscheidende Aufgabe, die die Lokalisierung interaktiver Mensch-Objekt-Paare und die Identifizierung der durchgeführten Aktionen umfasst. Die meisten bestehenden HOI-Detektoren sind überwacht und verfügen nicht über die Fähigkeit zur Zero-Shot-Entdeckung unbekannter Interaktionen. Kürzlich haben transformerbasierte Methoden die traditionellen CNN-Detektoren durch die Aggregation kontextueller Informationen über das gesamte Bild hinweg ersetzt, leiden jedoch weiterhin unter dem Problem der langen Verteilung in HOI. In dieser Arbeit konzentrieren wir uns hauptsächlich auf die Verbesserung der HOI-Erkennung in Bildern, insbesondere in Zero-Shot-Szenarien. Wir verwenden einen End-to-End-Transformer-basierten Objekterkenner, um Mensch-Objekt-Paare zu lokalisieren und visuelle Merkmale der Aktionen und Objekte zu erzeugen. Darüber hinaus nutzen wir den Text-Encoder eines beliebten visuellen Sprachmodells namens CLIP mit einem neuartigen Aufforderungsmechanismus, um semantische Informationen für unbekannte Aktionen und Objekte zu extrahieren. Schließlich lernen wir eine starke visuelle-semantische Ausrichtung und erzielen eine Spitzenergebnisleistung im herausfordernden HICO-DET-Datensatz über fünf Zero-Shot-Einstellungen, mit bis zu 70,88 % relativen Gewinnen. Der Code ist verfügbar unter https://github.com/sandipan211/ZSHOI-VLT.
Sarma et al. (2024) haben diese Frage untersucht.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: