基于音视频特征融合的婴幼儿哭泣检测方法研究
刘朋
周娴玮
龚启旭
余松森
华南师范大学软件学院 佛山 528225
摘要:目前婴儿哭泣检测领域单模态方法的识别精度难以提升,而婴幼儿相关的视频数据日益增加,在此背景下论文提出一种音视频融合的双模态方法检测婴儿哭泣,来达到进一步提高婴儿哭泣识别率目的.论文首先制作复杂环境下婴儿哭泣和非哭泣二分类的音视频数据集,并基于该数据集设计7种对比实验与CNN-3DCNN+LSTM音视频融合网络进行比较.实验表明该融合方法F1-score分数达到了93.2%,相比较单模态最优分数高 5.3%、多模态网络基准线高4.3%.证明了音视频融合方法在婴儿哭泣识别领域可行性.
关键词:婴幼儿哭泣音视频融合深度学习多模态网络
分类号:TP391.41(计算技术、计算机技术)
论文发表日期:2023-07-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 1534-1539 )
英文信息
