La comunicación es una parte muy importante de la vida humana. Pero pocos individuos enfrentan desafíos en la comunicación con otros debido a diversas razones, como problemas físicos o psicológicos. Estos problemas pueden llevar a la incapacidad de oír, hablar o ambas. Esto limita su acceso a la interacción social. Esto llevó a la creación de la lengua de señas. La lengua de señas se basa en gestos de las manos, expresiones faciales y movimientos del cuerpo. Permanece inaccesible para la mayoría de las personas, lo que amplía esta brecha de comunicación. Los avances en Inteligencia Artificial, Visión por Computadora y Procesamiento de Lenguaje Natural han abierto nuevas formas de cerrar esta brecha utilizando sistemas automatizados de reconocimiento de gestos. Los primeros sistemas dependían de guantes de datos, sensores de profundidad y modelos basados en CNN para detectar gestos de las manos. Sus principales deficiencias eran el hardware costoso y un vocabulario limitado de gestos. Muchos enfoques lograron el reconocimiento solo en condiciones controladas y carecían de robustez ante diferentes iluminaciones y entornos del mundo real. Sin embargo, la mayoría de los sistemas anteriores no proporcionaban soporte de comunicación como la conversión de voz o la traducción multilingüe. El sistema propuesto aborda estas deficiencias utilizando YOLOv8 para la detección de manos, MediaPipe para la extracción de puntos de referencia de 21, y un Transformador de Visión para la clasificación de gestos, logrando un 91% de precisión con una latencia de inferencia de CPU por debajo de 5 segundos. Las características adicionales incluyen conversión de voz a texto, texto a voz y traducción en seis lenguas regionales indias. Un front-end de Streamlit permite una experiencia de usuario accesible y sin hardware.
Raghava Mattegunta (Mon,) estudió esta cuestión.