结合语义分割图的注意力机制文本生成图像
梁成名
李云红
李丽敏
苏雪平
朱绵云
朱耀麟
西安工程大学电子信息学院,西安,710048
摘要:针对生成对抗网络生成图像存在结构不完整、内容不真实、质量差的问题,提出一种结合语义分割图的注意力机制文本到图像生成模型(SSA-GAN).首先采用一种简单有效的深度融合模块,以全局句子向量作为输入条件,在生成图像的同时,充分融合文本信息.其次结合语义分割图像,提取其边缘轮廓特征,为模型提供额外的生成和约束条件.然后采用注意力机制为模型提供细粒度词级信息,丰富所生成图像的细节.最后使用多模态相似度计算模型计算细粒度的图像-文本匹配损失,更好地训练生成器.通过CUB-200和Oxford-102 Flowers数据集测试并验证模型,结果表明:所提模型(SSA-GAN)与StackGAN、AttnGAN、DF-GAN以及RAT-GAN等模型最终生成的图像质量相比,IS指标值最高分别提升了13.7%和43.2%,FID指标值最高分别降低了34.7%和74.9%,且具有更好的可视化效果,证明了所提方法的有效性.
关键词:文本生成图像语义分割图像生成对抗网络注意力机制仿射变换
分类号:TP391.41(计算技术、计算机技术)
资助基金:国家自然科学基金(62203344)陕西省自然科学基础研究重点项目(2022JZ-35)
论文发表日期:2024-08-25
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:10( 118-127 )
英文信息展开
空军工程大学学报

空军工程大学学报

CSTPCD北大核心CSCD
ISSN:2097-1915
年,卷(期):2024,25(4)
所属栏目:网电对抗