知识-视觉深度协同的KB-VQA应用研究
赵俊东
余艳梅
陶青川
四川大学电子信息学院 四川成都 610065
摘要:知识的视觉问答(KB-VQA)任务旨在借助外部知识对复杂视觉问题进行解答,然而现有方法仍面临诸多挑战,如对文本检索知识的过度依赖易导致检索偏差、对图像视觉细节的捕捉能力不足,且预训练模型的深层推理能力未得到充分挖掘.针对上述问题,文章提出一种新型知识-图像融合与视觉特征集成模型(KIVI).该模型依托多模态预训练模型实现图文信息的深度融合,以此提升外部知识的检索精度;同时结合图像内容与检索知识,生成聚焦图像关联信息的视觉多模态知识.此外,KIVI模型整合图像的区域局部特征与全局整体特征,保障视觉信息的完整提取;并设计融合候选答案与推理路径的提示策略,有效激活预训练模型的深层推理能力.实验结果表明,KIVI模型在OK-VQA数据集上的准确率为67.29%,性能优于目前所有最优方法.
关键词:视觉问答知识检索多模态预训练模型深度学习
论文发表日期:2026-02-25
在线出版日期:2026-05-22(本平台首次上网日期,不代表文献的发表时间)
页数:5( 24-28 )
