基于卷积神经网络和Transformer的视频行人再识别
赵彦如
牛东杰
孙东红
杨蕙萌
河南理工大学 机械与动力工程学院,河南 焦作 454000
摘要:为了解决视频行人再识别领域仅使用卷积神经网络进行行人特征提取效果不佳的问题,提出一种基于卷积神经网络和Transformer的ResTNet(ResNet and Transformer network)网络模型.ResTNet利用ResNet50网络得到局部特征,令中间层输出作为Transformer的先验知识输入.在Transformer分支中不断缩小特征图尺寸,扩大感受野,充分挖掘局部特征之间的关系,生成行人的全局特征,同时利用移位窗口方法减少模型计算量.在大规模MARS数据集上,Rank-1和mAP分别达到 86.8%和 80.3%,比基准分别增加了 3.8%和 3.3%,在 2个小规模数据集上也取得了良好效果.在几大数据集上的大量实验表明,本文方法能增强行人识别的鲁棒性,有效提高行人再识别的准确率.
关键词:视频行人再识别卷积神经网络Transformer局部特征全局特征
分类号:TP391(计算技术、计算机技术)
资助基金:国家自然科学基金(51505133)河南省科技攻关计划项目(212102210316)河南理工大学光电传感与智能测控河南省工程实验室开放课题(HELPSIMC-2020-006)
论文发表日期:2023-12-28
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:8( 149-156 )
英文信息展开
河南理工大学学报(自然科学版)

河南理工大学学报(自然科学版)

CSTPCD北大核心
ISSN:1673-9787
年,卷(期):2023,42(6)
所属栏目:计算机·人工智能·大数据