基于时间序列分配和多频率分量压缩的人体行为识别
佘本杰1
朱彦敏2
宋健1
华健1
1.安徽理工大学 计算机科学与工程学院,安徽 淮南 2320012.安徽理工大学 机械工程学院,安徽 淮南 232001
摘要:为解决基于三维卷积神经网络(three dimensional convolutional neural network,3D-CNN)的人体行为识别在时间序列特征提取和特征压缩方面存在的不足,提出了更强的基于 3D-CNN的骨架动作识别(stronger 3D-CNN-based approach for skeleton-based action recognition,S-PoseConv3D)网络.该网络通过引入时间序列分配策略(time series allocation strategy,TSAS)和多频率分量特征压缩(multi-frequency component feature compression fusion,M3F)有效提升了PoseConv3D的性能.TSAS通过计算时间序列权重,动态调整不同时间序列在特征提取过程中的比重,从而增强了模型对人体行为时空特征的捕捉能力.M3F则利用离散余弦变换对特征图进行多频率分量的压缩和融合,进而保留了更多的时空信息,减少了全局池化导致的特征丢失.该网络在基于体操视频的数据集(dataset built on top of gymnastic videos,FineGYM)和南洋理工大学骨架行为识别数据集60 分类扩展版子集(Nanyang university of technology skeleton behavior recognition dataset 60 classification extended subset,NTU60-XSub)上进行了实验,其相比于原始PoseConv3D在FineGYM数据集上提升了 3.93%的平均最高准确率,在NTU60-XSub数据集上也有显著的性能提升,表现出更高的准确率和鲁棒性.该网络能够应用在安防监控、人机交互等领域.
关键词:行为识别三维卷积神经网络时空特征融合注意力机制离散余弦变换
分类号:TP394.1(计算技术、计算机技术)
资助基金:国家自然科学基金(52374155)安徽理工大学研究生创新基金项目(2023cx2132)
论文发表日期:2024-09-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 368-374 )
英文信息
