Los puntos clave no están disponibles para este artículo en este momento.
El procesamiento de imágenes inteligente basado en aprendizaje profundo es un método de inteligencia artificial que está surgiendo recientemente y que es crítico en los sistemas de computación de próxima generación. La detección de hablantes clave utilizando procesamiento de imágenes tiene como objetivo encontrar al hablante que desempeña el papel más importante en escenas complejas de múltiples personas. Sin embargo, los métodos existentes de detección de hablantes solo juzgan si hay alguien hablando. Para superar este problema, este documento propone un nuevo enfoque de detección de hablantes clave llamado Speaker Pose-Attention deteCtion modEl (SPACE). Este enfoque extrae la información espacial y analiza la atención que reúne a las personas para encontrar al hablante clave. El método consta de dos partes principales. La primera parte es nuestro modelo propuesto de detección de importancia (IDM) utilizando estimación de postura humana y una estrategia de evaluación efectiva para encontrar candidatos de hablantes importantes. La segunda parte consiste en el gráfico de atención de postura (PAG) y el algoritmo de análisis de enlaces. El PAG representa el gráfico de atención de las personas. El algoritmo de análisis de enlaces analiza la conectividad de este gráfico para encontrar al hablante clave. Debido a la falta de conjuntos de datos de detección de hablantes clave disponibles, se ha construido un conjunto de datos autocolectado que contiene escenas de habla y reuniones para estimar el modelo SPACE. Los resultados experimentales muestran que el método propuesto puede obtener la mejor precisión de detección en comparación con otros métodos existentes.
Zhao et al. (Sat,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: