Key points are not available for this paper at this time.
A detecção de Interação Humano-Objeto (HOI) reconhece como as pessoas interagem com objetos, o que é vantajoso em sistemas autônomos, como veículos autônomos e robôs colaborativos. No entanto, os atuais detectores de HOI frequentemente sofrem com ineficiência do modelo e falta de confiabilidade ao fazer uma previsão, o que limita seu potencial em cenários do mundo real. Neste trabalho, abordamos esses desafios propondo o ERNet, uma rede convolucional-transformer treinável de ponta a ponta para detecção de HOI. O modelo proposto emprega uma atenção deformável multi-escala eficiente para capturar efetivamente características vitais de HOI. Também apresentamos um novo módulo de atenção de detecção para gerar adaptativamente tokens de instância e interação semanticamente ricos. Esses tokens passam por detecções preemptivas para produzir propostas iniciais de região e vetor que também servem como consultas, o que aprimora o processo de refinamento de características nos decodificadores transformer. Várias melhorias impactantes também são aplicadas para melhorar o aprendizado de representação de HOI. Adicionalmente, utilizamos uma estrutura de estimativa de incerteza preditiva nas cabeças de classificação de instância e interação para quantificar a incerteza por trás de cada previsão. Com isso, podemos prever HOIs de forma precisa e confiável, mesmo em cenários desafiadores. Resultados experimentais nos conjuntos de dados HICO-Det, V-COCO e HOI-A demonstram que o modelo proposto atinge desempenho de ponta em precisão de detecção e eficiência de treinamento. Os códigos estão disponíveis publicamente em https://github.com/Monash-CyPhi-AI-Research-Lab/ernet.
Lim et al. (Sun,) estudaram essa questão.