融合提示信息的多模态视频描述生成
刘卫光1
左早雪2
1.中原工学院 软件学院,河南 郑州 4500072.中原工学院 计算机学院,河南 郑州 450007
摘要:视频描述任务存在难以获取关键局部特征和高阶关系的问题,常用模型SwinBERT中的Video Swin Trans-former 会产生许多不相关的特征与噪声.针对上述问题,提出了一种多模态视频描述生成模型PromptVid,利用自适应的多层感知机模块和自适应稀疏自注意力机制,设计了改进的Video Swin Transformer架构.实验结果表明,该模型能够生成准确、丰富的视频描述,具有有效性和较好的鲁棒性.
关键词:视频描述多模态自适应感知机注意力机制
分类号:TP391(计算技术、计算机技术)
资助基金:河南省科技攻关项目(242102210060)
论文发表日期:2025-06-25
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 13-19 )
英文信息
