As tecnologias de comunicação assistiva melhoraram significativamente a qualidade de vida de indivíduos com deficiências na fala e motoras. No entanto, os sistemas existentes frequentemente dependem de entradas unimodais, como texto ou voz, limitando sua usabilidade em cenários do mundo real. Este artigo propõe um framework de comunicação assistiva multimodal baseado em aprendizado profundo que integra entradas visuais, auditivas e textuais para permitir uma comunicação robusta e adaptativa. O framework utiliza redes neurais convolucionais (CNNs), redes neurais recorrentes (RNNs) e arquiteturas baseadas em transformadores para extração e fusão de características. Resultados experimentais demonstram uma precisão, responsividade e usabilidade melhoradas em comparação com sistemas tradicionais. O sistema proposto visa fornecer uma solução de comunicação inclusiva, escalável e em tempo real. Além disso, uma estratégia de fusão multimodal baseada em atenção é empregada para combinar efetivamente características heterogêneas e melhorar a compreensão contextual. O sistema é projetado para operar de forma confiável em condições barulhentas e dinâmicas, lidando com entradas incompletas ou ambíguas de diferentes modalidades. Considerações de design centradas no usuário são incorporadas para garantir acessibilidade, facilidade de uso e responsividade em tempo real. Resultados experimentais demonstram uma precisão, responsividade e usabilidade melhoradas em comparação com sistemas unimodais tradicionais. O framework proposto mostra um forte potencial para implantação em aplicações assistivas do mundo real, proporcionando uma solução de comunicação inclusiva, escalável e inteligente.
Nithya et al. (Ter,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: