자동차에 대한 수화 이해는 접근성, 지능형 교통 및 안전-critical한 인간-기계 상호작용의 교차점에 위치합니다. 기존의 수화 인식 시스템은 대체로 통제된 환경에 국한되어 있어 조명 변화, 움직임 흐림 및 부분 가림이 특징인 이동 시나리오에서의 유틸리티를 제한하고 있습니다. 본 논문에서는 공간적 시각 인코더, MediaPipe 기반 포즈 인코더, 양방향 LSTM 시간 인코더 및 맥락 인식 융합 및 안전 결정 모듈의 네 가지 구성 요소를 통합한 안전 인식 하이브리드 다중 모드 아키텍처인 STCM-HVNet을 제안합니다. 이 아키텍처는 수화 카테고리, 상호작용 의도 및 긴급성 수준을 동시에 예측하는 다중 작업 시스템으로 구성되며, 신뢰도 인식 거부 및 실패 안전 동작 매핑을 포함합니다. 아랍어 수화 자원 두 개에 대해 실험이 수행되었습니다. RGBArS 이미지 벤치마크(31개의 클래스, 7856개의 이미지)에서 제안된 파이프라인은 Top-1 정확도 45.38%, Top-3 정확도 75.15%, 매크로-F1 0.4479를 달성하여 LinearECOC, kNN-5 및 Bagged Trees 기준을 초과했습니다. 아랍어 수화 비디오 벤치마크(12개의 클래스, 479개의 클립)에서 BiLSTM 시간 인코더는 Top-1 정확도 93.15% 및 매크로-F1 0.9383에 도달하여 프레임 집합(87.67%) 및 CNN-LSTM(89.04%) 기준을 초과했습니다. 절단 결과는 시각 및 포즈 가지에서의 보완적 기여를 확인합니다. 안전 임계값 분석 및 몬테카를로 드롭아웃 비교를 통해 제안된 안전 결정/게이팅 레이어가 예측 범위와 신뢰성 사이의 조절 가능한 균형을 제공함을 보여줍니다.
Rasappan et al. (Mon,) 이 질문을 연구했습니다.