基于分段加权相似度匹配算法的中文科研机构名称归一化
沈沛
毛海涛
胡文林
刘宇麟
中国人民解放军92728部队 上海 200436
摘要:归一化是文本数据挖掘预处理的重要一步,实体名称归一化又占其中较大比重.实体名称归一化通常会用到字符串相似度匹配算法.以中文科研机构名称归一化为目标,提出了一种分段加权相似度匹配算法.算法将语料库中的科研机构全称进行合理的结构分段,将待归一化数据与分别分段字符串计算相似度,加权求和后选定相似度最大的全称作为归一化值.实验结果表明该方法效果良好,在中文科研机构名匹配和归一化方面有较大应用价值.
关键词:中文归一化文本相似度编辑距离
论文发表日期:2022-09-28
在线出版日期:2026-05-22(本平台首次上网日期,不代表文献的发表时间)
页数:4( 59-62 )
