基于概念关系的文本特征提取方法*
文必龙
李乃峰
任秀英
冯翔
吕鹏全
1.东北石油大学计算机与信息技术学院 大庆 1633182.东北石油大学计算机与信息技术学院 大庆 1633183.东北石油大学计算机与信息技术学院 大庆 1633184.东北石油大学计算机与信息技术学院 大庆 1633185.东北石油大学计算机与信息技术学院 大庆 163318
摘要:针对基于词频统计的T D‐ID F文本特征提取方法缺乏对文本中概念关系处理,而使提取到的文本特征具有概念冗余、特征不明确等问题,提出基于本体概念相似度的词频统计方法。利用文本元素之间的语义相似度调整特征元素的词频,突出特征元素的语义贡献、消除特征冗余,增强特征集合元素的特征独立性。最后结合文本概念的共现特性,对可能出现某些重要特征元素因词频统计而被忽略的问题进行处理,从而准确、高效地提取文本特征。
关键词:文本特征词频统计本体概念相似度共现特征
分类号:TP391.1(计算技术、计算机技术)
资助基金:国家科技重大专项(编号2011ZX05023-005-012)
论文发表日期:2014-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 2066-2068,2163 )
英文信息
