基于XLNet和深度卷积聚合的长文本分类模型
屈程浩1
薛涛1
胡伟华2
1.西安工程大学计算机科学学院 西安 7100482.西安工程大学人文社会科学学院 西安 710048
摘要:在长文本分类任务中,预训练语言模型受到输入长度的限制,无法获取长距离语义信息,而截断长文本会丢失分段之间的关联信息.针对此问题,论文提出了对截断文本进行聚合分类的模型.首先,通过XLNet语言模型得到截断文本的语义向量,使用双向长短期记忆网络(BiLSTM)提取分段的时序信息,利用多通道深层卷积(MDCNN)对分段的语义向量进行聚合.MDCNN使用层级池化压缩分段文本的序列长度,利用多通道卷积获取多段文本的关联特征.为解决深层网络导致模型参数较多的问题,MDCNN使用等长卷积提取长文本的语义特征,固定特征维度减少语义信息丢失,利用线性预激活函数进行残差连接,避免了残差连接中维度映射的过程,使模型达到更深的网络层数.实验对比了几种常用的文本分类模型,该模型能有效地对长文本数据进行建模,具有较好的分类效果.
关键词:文本分类XLNetBiLSTMCNN残差连接
分类号:TP301.6(计算技术、计算机技术)
资助基金:国家社会科学基金(18XYY010)
论文发表日期:2024-09-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 2640-2644,2674 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2024,52(9)
所属栏目:信息融合