一种基于改进的K-means算法的人名消歧系统的设计与实现
杨欣欣
李培峰
朱巧明
王英帅
1.苏州大学计算机科学与技术学院,苏州,2150062.苏州大学计算机科学与技术学院,苏州,2150063.苏州大学计算机科学与技术学院,苏州,2150064.苏州大学计算机科学与技术学院,苏州,215006
摘要:人名歧义是一种身份不确定的现象,指的是文本中具有相同姓名的字符串指向现实世界中的不同实体人物.人名消歧很长时间一直是一个具有挑战性的问题,关注网页里的人名消歧的问题.因为经典的K-means算法如果选择了一个差的随机初始聚类中心,算法会遇到局部收敛的问题,所以文章提出一种基于最大最小原则的改进的K-means算法来进行人名消歧.同时使用了WePS的训练数据作为实验的语料.实验结果表明,改进的方法比层次聚类方法有着更好的性能.
关键词:人名消歧聚类最大最小原则
分类号:TP391(计算技术、计算机技术)
资助基金:国家自然科学基金(90920004)国家自然科学基金(60970056)国家自然科学基金(60873150)江苏省自然科学基金(BK2008160)江苏省高校自然科学重大基础研究项目(08KJA520002)
论文发表日期:2010-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 10-12,17 )
英文信息
