基于ResNet18与Transformer混合的视线估计方法
王艳霞
刘丹
重庆师范大学计算机与信息科学学院 重庆 401331
摘要:CNN具有强大的特征提取能力,但由于感受野有限,难以捕获全局信息,而Transformer则因其长距离建模能力能够有效获取全局特征,并且针对视线估计任务中眼睛区域微小变化易导致视线角度显著偏差的问题,论文提出GazeTR-LM模型,通过结合CNN与Transformer的优势,并引入注意力机制和MAD(Multi-Attention Dropping),增强模型对眼部关键区域的关注度,实现局部区域的自适应探索,有效抑制冗余信息干扰,从而提升整体性能.为验证模型有效性,在EyeDiap、MPIIFaceGaze和Gaze360三个数据集上进行了实验,实验结果表明,与目前较好的GazeTR-Hybrid模型相比,GazeTR-LM的性能在EyeDiap、MPIIFaceGaze、Gaze360数据集上分别提高了1.4%、3.5%和2.8%.
关键词:Transformer视线估计注意力机制正则化
分类号:TP39(计算技术、计算机技术)
资助基金:重庆市科委科学研究项目(cstc2021jcyj-msxm2791)重庆市教委科技项目(KJZD-K202200513)
论文发表日期:2025-09-20
在线出版日期:2025-12-23(本平台首次上网日期,不代表文献的发表时间)
页数:4( 2461-2464 )
英文信息
