跨模态交互与动态融合的RGB-T图像语义分割模型
何昕怡
朱黎
谭寒钟
李云
周远鑫
湖北民族大学 智能科学与工程学院,湖北 恩施 445000
摘要:针对可见光-热成像(red-green-blue-thermal,RGB-T)图像语义分割中模态特征失配与热成像过曝光噪声导致的精度下降问题,提出了基于跨模态交互与动态融合的RGB-T图像语义分割(cross-modal interaction and dynamic fusion for RGB-T image semantic segmentation,CIDF)模型,实现RGB-T模态的高效协同感知.首先,设计了跨模态跳跃连接(cross-modal skip connection,CMSC)机制,在编码阶段建立RGB-T模态的多尺度特征交互,通过跨层级特征传递与自适应聚合策略,有效缓解模态间特征分布差异.其次,提出了多模态卷积融合模块(multi-modal convolution fusion module,MCFM),通过卷积实现了动态特征优选,抑制了热成像模态的过曝光噪声干扰.实验基于公开的多光谱图像融合网络的城市道路场景(multi-spectral image fusion net for urban road scenes,MFNet)数据集及光伏巡检场景的自建数据集.结果表明,在MFNet数据集上,CIDF模型取得 72.9%平均准确率和 56.6%平均交并比.此外,在光伏巡检数据集上平均准确率和平均交并比分别达到 98.9%和 97.4%.该研究成果不仅验证了CIDF模型的有效性,也证明了其在跨场景应用中的优越性能.
关键词:CMSC模块MCFM模块多模态融合双分支编码器RGB-T语义分割场景自适应
分类号:TP391.41(计算技术、计算机技术)TN219(光电子技术、激光技术)
资助基金:湖北省科技厅联合基金项目(2025AFD161)
论文发表日期:2025-09-20
在线出版日期:2025-09-24(本平台首次上网日期,不代表文献的发表时间)
页数:6( 370-375 )
英文信息展开
湖北民族大学学报(自然科学版)

湖北民族大学学报(自然科学版)

ISSN:2096-7594
年,卷(期):2025,43(3)
所属栏目:专栏:智能科学与工程