Los puntos clave no están disponibles para este artículo en este momento.
Describe una interfaz para la interacción humano-robot multimodal, que permite a las personas presentar un nuevo robot a diferentes atributos de objetos y lugares en la habitación a través de comandos de voz y gestos de las manos. El robot crea un mapa del entorno de la habitación basado en el conocimiento aprendido a través de la comunicación con los humanos y utiliza este mapa para la navegación. El sistema desarrollado consta de varias secciones que incluyen: procesamiento de lenguaje natural, reconocimiento de posturas, localización de objetos y generación de mapas. Este sistema utiliza una combinación de múltiples fuentes de información y coincidencia de modelos para detectar y rastrear una mano humana, de modo que el usuario pueda señalar un objeto de interés y guiar al robot para que se acerque a él o localizar la posición de ese objeto en la habitación. La posición de los objetos en la habitación se localiza mediante visión monocular y el método de profundidad a partir del enfoque.
Ghidary et al. (Wed,) estudiaron esta cuestión.