Key points are not available for this paper at this time.
Dieser Artikel präsentiert INGRESS, ein Robotersystem, das menschliche Anweisungen in natürlicher Sprache befolgt, um Alltagsgegenstände zu greifen und zu platzieren. Die zentrale Frage dabei ist, Bezugsausdrücke zu verankern: Ausdrücke über Objekte und deren Beziehungen aus Bild- und Spracheingaben zu verstehen. INGRESS erlaubt uneingeschränkte Objektkategorien und reichhaltige Sprachäußerungen. Zudem stellt es Fragen, um unklare Bezugsausdrücke interaktiv zu klären. Um dies zu erreichen, verfolgen wir den Ansatz der Verankerung durch Generierung und schlagen ein zweistufiges neuronales Netzwerkmodell zur Verankerung vor. Die erste Stufe nutzt ein neuronales Netzwerk, um visuelle Beschreibungen von Objekten zu generieren, vergleicht sie mit den Spracheingaben und identifiziert eine Menge von Kandidatenobjekten. Die zweite Stufe verwendet ein weiteres neuronales Netzwerk, um alle paarweisen Beziehungen zwischen den Kandidaten zu untersuchen und die wahrscheinlichsten referenzierten Objekte abzuleiten. Dieselben neuronalen Netzwerke werden sowohl für die Verankerung als auch für die Generierung von Fragen zur Disambiguierung verwendet. Experimente zeigen, dass INGRESS eine hochmoderne Methode im RefCOCO-Datensatz und in Roboterversuchen mit Menschen übertroffen hat. Der INGRESS-Quellcode ist verfügbar unter https://github.com/MohitShridhar/ingress.
Shridhar et al. (Thu,) untersuchten diese Frage.