基于连续帧信息融合建模的小样本视频行为识别方法
张冰冰
李海波
马源晨
张建新
大连民族大学 计算机科学与工程学院,辽宁 大连 116650
摘要:目的 为克服现有基于小样本学习的视频行为识别方法在全局时空信息获取及复杂行为建模方面的局限,开发一种新型网络架构,以显著提升小样本学习在视频行为识别中的准确性和鲁棒性.方法 提出一种结合连续帧信息融合模块和多维注意力建模模块的网络架构.连续帧信息融合模块位于网络的输入端,多维注意力建模模块则设置在网络的中间层,整个网络基于2D卷积模型设计,可有效降低计算复杂度.结果 在Something-Something V2,Kinetics-100,UCF101 和HMDB51 共 4 个主流行为识别数据集上进行实验,结果表明,所提方法在Something-Something V2数据集上的1-shot和5-shot任务中准确率分别达到50.8%和68.5%;在Kinetics-100数据集上,所提方法的1-shot和5-shot任务准确率分别为68.5%和83.8%,比现有方法显著提升;在UCF101数据集上,本文方法的1-shot任务准确率为81.3%,5-shot任务准确率为93.8%,在不同配置下均显著优于基线方法的;在HMDB51数据集上,1-shot任务的准确率为56.0%,5-shot任务的准确率为74.4%,展现了良好的泛化性能.结论 连续帧信息融合建模网络在提高模型对复杂时空信息处理能力方面表现出显著优势,本文解决方案为小样本视频行为识别领域带来了有效的新方法,且具有高效性和实用性.
关键词:小样本学习视频行为识别时空建模时空表征学习连续帧信息
分类号:TP273(自动化技术及设备)
资助基金:国家自然科学基金(61972062)吉林省科技发展计划项目(20230201111GX)辽宁省应用基础研究计划项目(2023JH2/101300191,2023JH2/101300193)先进设计与智能计算省部共建教育部重点实验室开放课题(ADIC2023ZD003)
论文发表日期:2025-07-31
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:10( 11-20 )
英文信息
