语音情感识别(SER)是人机交互(HCI)、心理健康诊断和情感计算的重要贡献。然而,由于语音信号的非平稳性和说话者的变异性等挑战,SER仍然具有挑战性。本研究介绍了一种增强可变形卷积的分层Swin Transformer网络(DUST-Net),并结合了令牌修剪和不确定性感知注意力,以实现稳健的SER。这种方法整合了基于小波的多尺度特征提取、可变形卷积和自适应令牌修剪,以有效捕获局部和全局情感特征。信号预处理、基于Hiking优化算法的优化和DeepLIFT可解释性进一步提高了性能和透明度。实验结果达到98.75%的准确率,展示了情感识别的稳健性、可推广性和效率。
Jain等人(周五)研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: