본 논문에서는 차량 주행 영상과 오디오 신호를 동시에 활용하는 멀티모달 기반 차량 속도 예측 시스템을 제안하고, 기존 단일 모달 기반 딥러닝 모델과의 성능을 비교·분석하였다. 제안 시스템은 블랙박스 영상과 엔진음을 입력으로 사용하며, 오디오 영역에서는 MFCC(Mel-Frequency Cepstral Coefficients) 특징을 추출하고 비디오 영역에서는 Optical Flow 및 프레임 차분 기반 특징을 활용하여 각 모달리티별 속도 예측 모델을 구성하였다. 이후 각 모달리티에서 산출된 예측 결과를 후기 결합(Late Fusion) 방식으로 통합하여 최종 차량 속도를 추정한다. 실험 결과, 제안한 멀티 모달 접근 방식은 단일 모달리티 기반 방법에 비해 더 높은 예측 정확도와 안정적인 성능을 보였다. 특히 특정 모달리티의 정보가 제한되거나 일부 데이터 품질이 저하된 환경에서도 서로 보완적인 정보를 활용함으로써 보다 신뢰성 있는 속도 추정이 가능함을 확인하였다. 또한 다양한 주행 환경에서의 적용 가능성을 분석하여 시스템의 실용성을 검증하였다. 다만, 다중 특징 추출 과정으로 인한 연산량 증가와 환경 변화에 따른 특징 민감도는 향후 개선이 필요한 한계로 분석되었다.
Park et al. (2026) studied this question.