基于改进注意力机制的多路卷积课堂语音情感识别模型
梁科晋
张海军
新疆师范大学计算机科学技术学院 乌鲁木齐 830054
摘要:针对语音情感识别研究中增加网络的深度和宽度对识别准确率提高不明显的情况,改进了注意力机制,通过将通道注意力机制和空间注意力机制相结合,并将空间注意力机制的卷积部分改进为两层的空洞卷积,以便提取更多有价值的上下文语义信息;针对单一的情感特征无法有效表征语音情感,将多个单一情感特征进行融合,增加特征的情感表征能力.该模型在中科院自动化所汉语情感数据库(CASIA)下得到了85.24%的识别准确率,在Emo-DB数据集上得到86.58%的识别准确率,证明了模型的有效性.针对真实的课堂语音数据,该模型在实验中召回率、F1值和准确率分别达到77.77%、80.76%、79.24%,体现了较好的实用性.
关键词:情感识别深度学习语音情感识别神经网络不均衡数据集
分类号:TP391.7(计算技术、计算机技术)
资助基金:新疆维吾尔自治区创新环境建设专项人才专项计划(2019XS08)国家自然科学基金(U1703261)
论文发表日期:2024-09-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 2645-2650 )
英文信息
