基于cBert-GCN的煤矿"三违"数据短文本分类
吴徐燕
杨超宇
安徽理工大学 人工智能学院,安徽 淮南 232001
摘要:针对煤矿"三违"文本分类数据存在专业性强、语义易混淆、样本比例失衡 3 种问题,提出cBert-GCN煤矿"三违"文本分类模型.考虑到存在除专业领域信息外,煤矿"三违"文本数据简短,同时具有上下文关联紧密以及固有二义性,引入拼音、字形向量以增强表达煤矿"三违"文本数据.文章将GCN用于煤矿"三违"文本分类中,构建文本共现图以捕获文本中的结构信息和依赖关系,采用中文预训练模型和图卷积神经网络结合的方式进行特征学习,融合字符级和词级,设置二者权重以实现对煤矿"三违"数据的准确分类.结果表明:cBert-GCN模型在训练样本上的准确率高于其他模型达到97.03%,且在测试样本中准确率达到 93.17%,具备良好泛化能力.因此,cBert-GCN模型在煤矿"三违"文本数据方面具有比较明显的应用优势.
关键词:煤矿"三违"GCN特征学习训练样本文本共现
分类号:TD-05(矿业工程理论与方法论)
资助基金:国家自然科学基金(52227901)
论文发表日期:2026-01-20
在线出版日期:2026-03-10(本平台首次上网日期,不代表文献的发表时间)
页数:8( 184-191 )
英文信息展开
煤炭工程

煤炭工程

CSTPCD北大核心
ISSN:1671-0959
年,卷(期):2026,58(1)
所属栏目:研究探讨