基于通用视觉大模型与注意力增强的无监督异常检测
王镇1
翟轲2
薛赛2
白双1
1.北京交通大学电子信息工程学院,北京 1000442.中国铁路北京局集团有限公司丰台西站,北京 100070
摘要:针对现有无监督异常检测方法普遍存在特征提取不充分和不能有效关注异常区域导致检测性能下降的问题,提出一种基于通用视觉大模型——视觉变换器(Vision Transformer,ViT)与注意力增强的无监督异常检测方法.首先,利用预训练的通用视觉ViT模型对输入图像进行特征提取.其次,为进一步增强模型对异常区域的关注度,引入通道与空间注意力模块(Convolutional Block At-tention Module,CBAM),在特征提取阶段自适应调整特征权重,以更精准地捕捉局部异常信息.最后,本文在MVTec工业数据集与自制钢缆异常数据集上进行了大量实验,全面评估所提方法的检测性能.实验结果表明:所提方法在无监督异常检测任务上优于同期多种主流方法.在钢缆异常数据集上,所提方法的图像级受试者特征曲线下面积(Image-wise Area Under ROC,Image-wise AUROC)和F1-Score平均值分别达到88.1%和80.8%,较基准Fastflow算法提升了 11.7%和7.8%.
关键词:异常检测无监督检测机器视觉视觉大模型注意力机制
分类号:TP391.41(计算技术、计算机技术)
论文发表日期:2025-06-30
在线出版日期:2025-08-21(本平台首次上网日期,不代表文献的发表时间)
页数:9( 14-22 )
英文信息
