基于双流Transformer网络的行为识别算法
邰爱兵
查可可
南京航空航天大学计算机科学与技术学院 南京 210000
摘要:近年来,大部分的研究工作都是基于3DConvNet去构建模型,提取时序特征,并逐步优化.然而,3DConv也带来了计算量需求不足,部署成本高的问题.鉴于VIT在序列数据特征提取上的优势,论文提出了基于Transformer的双流网络模型(Two-stream Vision Transformer Network,TVTN).为了适应不同长度的视频,TVTN通过对视频进行分段稀疏采样,获得RGB帧以及对应光流图像,通过VIT Hybrid算法对光流图像的处理得到动作的时序特征,通过对RGB帧的处理得到动作的空间特征.将两个网络的预测结果进行融合,完成对视频级别的行为识别任务.论文在实验中分别讨论了不同的VIT和VIT Hybrid在Flow和视频中的表现,以及在结果融合中不同权重值,不同帧数的输入对TVTN实验结果的影响.实验结果表明,仅在经过ImageNet上预训练的TVTN网络,在UCF-101数据集上准确率达到了 96.1%,并且在HMDB-51的数据集中也有良好的提升表现,证明了该模型在视频行为分类中的有效性.
关键词:行为识别Vision Transformer计算机视觉
分类号:TP301.6(计算技术、计算机技术)
资助基金:国家重点研发计划(2017YFB0802303)国家自然科学基金(62076127)
论文发表日期:2025-08-20
在线出版日期:2025-12-12(本平台首次上网日期,不代表文献的发表时间)
页数:6( 2089-2094 )
英文信息
