Key points are not available for this paper at this time.
Tiefe neuronale Netzwerke haben in den letzten Jahren bemerkenswerte Fortschritte erzielt und in vielen Forschungsbereichen der KI erstklassige Ergebnisse erzielt. Es ist oft unbefriedigend, nicht zu wissen, warum sie das vorhersagen, was sie tun. In diesem Papier adressieren wir das Problem der Interpretation von Modellen zur visuellen Fragenbeantwortung (VQA). Insbesondere sind wir daran interessiert, herauszufinden, auf welchen Teil des Inputs (Pixel in Bildern oder Wörter in Fragen) sich das VQA-Modell während der Frage konzentriert. Um dieses Problem anzugehen, verwenden wir zwei Visualisierungstechniken – geleitete Rückpropagation und Okklusion – um wichtige Wörter in der Frage und wichtige Regionen im Bild zu finden. Anschließend präsentieren wir qualitative und quantitative Analysen dieser Wichtigkeitskarten. Wir fanden heraus, dass selbst ohne Aufmerksamkeitsmechanismen VQA-Modelle manchmal implizit relevante Regionen im Bild ansprechen und oft auch passende Wörter in der Frage.
Goyal et al. (Wed.) haben diese Frage untersucht.