Los puntos clave no están disponibles para este artículo en este momento.
Este artículo informa sobre un sistema simplificado para determinar la normalización del tracto vocal. Tal normalización ha llevado a ganancias significativas en la precisión del reconocimiento al reducir la variabilidad entre hablantes y permitir la agrupación de datos de entrenamiento y la construcción de modelos más precisos. Sin embargo, los métodos estándar para determinar la escala de distorsión han sido extremadamente engorrosos, generalmente requiriendo múltiples pasadas de reconocimiento. Presentamos un nuevo sistema para la selección de la escala de distorsión que utiliza un modelo de habla con voz genérico simple para seleccionar rápidamente escalas de frecuencia apropiadas. La selección está lo suficientemente optimizada como para que pueda ser trasladada completamente al procesamiento de primer nivel. Usando este sistema en una prueba estándar del Corpus Switchboard, hemos logrado reducciones relativas en las tasas de error de palabras del 12% sobre los modelos no normalizados independientes de género y del 6% sobre nuestros mejores modelos no normalizados dependientes de género.
Wegmann et al. (Tue,) estudiaron esta cuestión.