基于文本集密度的特征词选择与权重计算方法
吴卫华1
袁宁2
周劲2
王洪军1
1.山东省智奥电算开发中心,济南,2500132.济南大学信息科学与工程学院,济南,250022
摘要:根据汉语语言自身的特点,在基于原有的特征项提取方法基础之上,提出了基于文本集密度的特征词选择的思想,对于特征项个数和选择进行了界定,找出了不损失文本有效信息的最小特征词语集,并且利用其中的中间值作为词语权重计算的一部分,创造出更为合理的权重计算方案.最后利用一种新的衡量权重好坏的标准--元打分法,对文中所提出的方法的正确性和有效性进行了实验和证明.
关键词:文本分类分词特征选择权重计算方案
分类号:TP391(计算技术、计算机技术)
资助基金:山东省自然科学基金(Y2001G03)
论文发表日期:2005-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 11-13,52 )
英文信息
