基于扩散模型的恶意代码数据集扩充方法
李思聪1
王坚1
宋亚飞1
王硕2
冯存前1
1.空军工程大学防空反导学院,西安,7100512.95285部队,广西桂林,541000
摘要:随着大数据的支撑,深度学习模型在计算机视觉和自然语言处理等领域展现出卓越的能力.然而,在恶意代码图像领域应用中,可能会出现训练数据不足的情况.由于部分恶意家族训练样本数量有限,无法充分描述整个数据集的分布特征,深度学习模型可能会过度拟合于这些稀缺数据,导致模型的性能不佳.针对以上问题,提出一种基于扩散模型生成新样本的数据集扩充方法,通过学习从原始数据到噪声的转换过程,并利用反向过程还原噪声样本为新的相似样本,实现数据集的扩充,生成与原始数据集相似但不同的新样本,以缓解部分家族数据不平衡对分类检测任务的影响,提高模型的泛化能力.
关键词:恶意代码检测扩散模型恶意代码可视化数据增强技术U-Net
分类号:TP309(计算技术、计算机技术)
资助基金:国家自然科学基金(61806219)国家自然科学基金(61703426)国家自然科学基金(61876189)陕西省自然科学基础研究计划项目(2021JM-226)陕西省高校科协青年人才托举计划项目(20190108)陕西省高校科协青年人才托举计划项目(20220106)陕西省创新能力支撑计划项目(2020KJXX-065)
论文发表日期:2025-02-24
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:9( 95-103 )
英文信息
