지능형 비디오 분석 도구는 보안 강화 및 특이 사건 모니터링을 위한 여러 장소에 카메라가 설치되어 크게 발전했습니다. 그러나 폭력 사건의 효과적인 탐지와 모니터링은 종종 수작업 노력과 녹화된 영상을 시간 소모적으로 분석하는 데 의존하게 되어, 시의적절한 개입이 지연될 수 있습니다. 딥 러닝은 폭력 행동을 식별하고 분류하는 데 필수적인 중요한 특성을 추출하는 강력한 방법으로 부상하였으며, 다양한 분야에서 정확하고 확장 가능한 모델 개발을 가능하게 합니다. 이 연구는 비디오 기반 폭력 인식을 위해 2차원 합성곱 신경망(2D-CNN)과 3D-CNN을 통합한 Int.2D-3D-CNN 아키텍처를 제시합니다. 전통적인 2D-CNN 및 3D-CNN 모델과 비교하여 제안된 Int.2D-3D-CNN 모델은 Hockey Fight, Movie 및 Violent Flows 데이터셋에서 성능을 향상시킵니다. 이 아키텍처는 공간 및 시간 정보를 통합하여 폭력 장면의 정적 및 동적 특성을 모두 포착합니다. 구체적으로, 2D-CNN 구성 요소는 각 프레임에서 공간적 특징을 추출하기 위해 경량의 MobileNetV1 및 MobileNetV2를 사용하며, 단일 3D 합성곱 층을 가진 간소화된 3D-CNN 모듈은 시퀀스 전반에 걸쳐 운동 및 시간 의존성을 캡처합니다. 평가 결과는 제안된 모델이 다양한 조건에서 폭력 비디오와 비폭력 비디오를 정확하게 구분하는 강력성을 강조합니다. Int.2D-3D-CNN 모델은 각각 Hockey Fight, Movie 및 Violent Flows 데이터셋에서 98%, 100%, 98%의 정확도를 달성하여 폭력 인식 응용 프로그램에 대한 강력한 잠재력을 나타냅니다.
Getsopon 외 (화요일), 이 문제를 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: