Key points are not available for this paper at this time.
인간-객체 상호작용(HOI) 탐지는 사람이 객체와 상호작용하는 방식을 인식하며, 이는 자율 시스템(예: 자율주행 차량 및 협동 로봇)에서 유리합니다. 그러나 현재의 HOI 탐지기는 예측을 할 때 모델 비효율성과 신뢰성 결여로 어려움을 겪고 있어, 실제 시나리오에서의 잠재력을 제한합니다. 본 논문에서는 ERNet을 제안하여 이러한 문제를 해결하고자 합니다. ERNet은 HOI 탐지를 위한 끝마치기 가능한 학습형 합성곱-변환기 네트워크입니다. 제안된 모델은 중요 HOI 특징을 효과적으로 포착하기 위해 효율적인 다중 스케일 변형 주의를 사용합니다. 또한, 의미론적으로 풍부한 인스턴스 및 상호작용 토큰을 적응적으로 생성하기 위한 새로운 탐지 주의 모듈을 제안합니다. 이러한 토큰은 초기 영역 및 벡터 제안 생성을 위한 사전 탐지를 거쳐 변환기 디코더의 특징 정제 과정을 개선하는 쿼리 역할도 합니다. HOI 표현 학습을 향상시키기 위해 여러 가지 효과적인 개선 사항도 적용하였습니다. 추가로, 인스턴스 및 상호작용 분류 헤드에서 예측 불확실성 추정 프레임워크를 활용하여 각 예측 뒤의 불확실성을 정량화합니다. 이를 통해 우리는 도전적인 시나리오에서도 HOI를 정확하고 신뢰할 수 있게 예측할 수 있습니다. HICO-Det, V-COCO 및 HOI-A 데이터셋에 대한 실험 결과는 제안된 모델이 탐지 정확성과 학습 효율성에서 최신 성과를 달성했음을 보여줍니다. 코드는 https://github.com/Monash-CyPhi-AI-Research-Lab/ernet 에서 공개되어 있습니다.
Lim 외 (Sun,)은 이 질문을 연구하였습니다.