会议场景下基于注意力机制的语音分离识别算法
赵成宝
张中海
甘肃同兴智能科技发展有限责任公司 甘肃兰州 730050
摘要:在会议场景下,语音信号往往处于叠加状态,这会导致语音信号序列出现梯度爆炸或梯度消失的问题,进而降低语音识别的准确性.为此,文章开展了基于注意力机制的会议场景语音分离识别算法研究.首先,利用短时傅里叶变换将原始会议场景下的混合语音信号转换为语谱图形式;然后,通过包络检测提取语音信号的调制幅度谱,并将其作为编码器的输入.在分离器中,对编码器输出进行分割和SepFormer处理,以分离得到独立分布的语音信号.引入自注意力机制,通过多头学习处理输入的独立语音信号,并联合利用独立语音信号在不同空间的信息,从而在避免梯度爆炸或梯度消失问题的同时,准确识别并输出语音信息.在测试数据集上,所设计的算法分离输出的语音信号频域分布误差稳定在0.05 Hz以内,且对语音信息的准确识别率达到了 99.9%.
关键词:会议场景注意力机制语音分离识别短时傅里叶变换调制幅度谱SepForme多头学习
论文发表日期:2025-12-25
在线出版日期:2026-05-22(本平台首次上网日期,不代表文献的发表时间)
页数:4( 91-94 )
信息技术与信息化

信息技术与信息化

ISSN:1672-9528
年,卷(期):2025,(12)
所属栏目:电子与通信技术