基于多算法融合的文本抄袭检测的特征提取算法研究
陈滔1
张庆国2
何金波3
周文竹4
1.安徽农业大学 工学院,合肥230036;甘肃政法大学 民商经济法学院,兰州7200702.安徽医科大学 临床医学院,合肥2300313.安徽农业大学 工学院,合肥2300364.安徽农业大学 资源与环境学院,合肥230036
摘要:特征提取是文本抄袭检测的重要环节,文本特征提取结果的质量将直接影响检测的可靠性.针对现有方法的不足,提出一种基于多算法融合的文本特征提取算法.该方法考虑到文本写作主题和写作风格对文本特征提取结果的影响,通过LDA主题模型、同义词林和GloVe&TF-IDF分别提取文本写作风格和文本主题的3个分特征向量,利用变分自编码器(VAE)进行混合和降维,提取出能够高度代表文本的融合特征向量.实验结果表明,该文本特征提取算法能够准确选择文本的特征集,解决了传统特征提取算法未考虑到文本写作风格和文本主题的缺点,检测的精确率达到了97.93%,相较于其他算法有所提高.
关键词:特征提取抄袭检测多算法融合写作风格文本主题
分类号:TP391(计算技术、计算机技术)TP301.6(计算技术、计算机技术)
资助基金:安徽农业大学优才计划科研发展资助项目(xszz202006)技术带头人及后备人选学术科研活动经费项目(2016H072)
论文发表日期:2022-03-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 67-72 )
英文信息展开
湖北民族大学学报(自然科学版)

湖北民族大学学报(自然科学版)

ISSN:1008-8423
年,卷(期):2022,40(1)
所属栏目:计算机科学与技术