Key points are not available for this paper at this time.
음성 인식 성능은 원거리 대화 환경에서 크게 저하되며, 이 경우 음성 신호는 부가적인 잡음과 잔향으로 인해 심각하게 왜곡될 수 있습니다. 이러한 환경에서는 마이크 배열을 사용하여 캡처된 음성 신호의 품질을 개선하는 방법이 제안되었습니다. 현재, 마이크 배열 기반 음성 인식은 배열 처리와 인식이라는 두 개의 독립적인 단계에서 수행됩니다. 신호 향상을 위해 설계된 배열 처리 알고리즘은 특징 추출 및 인식 전에 음성 파형의 왜곡을 줄이기 위해 적용됩니다. 이 접근 방식은 음성 파형의 품질을 개선하는 것이 인식 성능 개선으로 이어질 것이라고 가정하며, 음성 인식 시스템이 작동하는 방식은 무시합니다. 본 논문에서는 배열 처리의 목표가 향상된 출력 파형을 생성하는 것이 아니라 올바른 가설을 생성하는 가능성을 극대화하는 특징의 시퀀스를 생성하는 새로운 방법이 제안됩니다. 가능성 극대화 빔포밍이라고 불리는 이 접근 방식에서는 음성 인식 시스템 자체의 정보를 사용하여 필터 및 합성 빔포머를 최적화합니다. 실제 원거리 대화 환경에서 수행된 음성 인식 실험은 제안된 접근 방식의 효율성을 확인합니다.
Seltzer 외. (Mon,) 이 질문을 연구했습니다.