Pesquisas mostraram que capacidades aprimoradas de percepção e inferência permitem que robôs socialmente inteligentes tomem decisões mais informadas. Em interações conscientes do humano, uma compreensão confiável das pistas de comunicação, verbais e não verbais, é essencial. No entanto, existem evidências limitadas do mundo real sobre como a percepção multimodal pode compensar as limitações de modalidades únicas. Este estudo investiga o uso combinado de sinais verbais e não verbais para orquestrar a navegação e o controle de movimento do robô. Integramos um pipeline de estimativa de pose humana para reconhecimento de gestos e posturas com um pipeline de assistente virtual aprimorado por um LLM local para compreensão de linguagem natural. O módulo de gestos é projetado para interação de usuário único, embora o sistema também seja testado em cenários onde um segundo participante está presente. Participantes em um laboratório vivo forneceram gestos, posturas e comandos de voz a um robô de serviço móvel. O sistema utiliza LiDAR e uma câmera RGB-D para rastreamento de trajetória e reconhecimento de gestos, um microfone acompanhado por um pipeline de processamento de linguagem natural, e um LLM local para interpretar comandos falados e gerar instruções de navegação. O desempenho é avaliado em termos de precisão de controle de movimento e resolução de conflitos entre modalidades. Os resultados demonstram precisões de reconhecimento de 95% para comandos baseados em gestos e 93% para comandos baseados em voz, sem conflitos durante a arbitragem multimodal. Essas descobertas indicam que pistas multimodais podem aumentar a confiabilidade, segurança, eficiência e robustez em ambientes barulhentos ou obstruídos. No geral, o estudo fornece uma abordagem de engenharia e evidência empírica que apoia a percepção e inferência multimodais na interação humano-robô, destacando seu potencial para desenvolver assistentes autônomos e socialmente conscientes em ambientes ubíquos.
Aboki et al. (Mon,) estudaram essa questão.