增强视觉特征的视觉问答任务研究
秦淑婧
杨关
1.中原工学院计算机学院,河南郑州4500072.中原工学院计算机学院,河南郑州450007
摘要:视觉问答是一种涉及计算机视觉和自然语言处理两大领域的学习任务.该任务融合视觉和语言的特征实现问答,是多模态研究的重要任务之一,已经成为人工智能领域的一个研究重点.通过对已有模型的分析,现有方法在进行图像特征表示时,仅仅只采用图像的网格特征、对象特征等整体视觉特征,而忽略了图像中对象本身以及不同对象之间的位置信息.提出在原有视觉特征的基础上,引入图像中每个对象的坐标信息,得到增强的视觉特征,使模型能够更加准确地学习图像中所蕴含的深层语义.在VQA-v2数据集上的对比实验证明,在图像特征中融入对象的坐标信息有效提高了本文模型的性能.
关键词:视觉问答深度学习注意力机制对象位置坐标信息
分类号:G642(高等教育)
资助基金:国家自然科学基金(U1404606)河南省科技攻关计划(182102210126)
论文发表日期:2020-02-25
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:7( 56-61,73 )
英文信息展开
中原工学院学报

中原工学院学报

ISSN:1671-6906
年,卷(期):2020,31(1)
所属栏目:信息科学与技术