实体消歧中特征文本选取研究
庞焜元
唐晋韬
李莎莎
王挺
1.国防科技大学 长沙 4100732.国防科技大学 长沙 4100733.国防科技大学 长沙 4100734.国防科技大学 长沙 410073
摘要:在实体消歧问题中,特征文本是指输入实体消歧系统的用于表征实体指称和候选实体的文本,其质量对于实体消歧的性能有重要的影响.论文对特征文本的选取问题进行研究,针对网络文本的特点,综合考虑文本中的特殊字符、特征文本的位置、特征文本是否包含实体指称和特征文本的单句长度等因素,对文本进行筛选和处理,产生特征文本,以提高实体消歧的效果.论文在深度结构语义网(Deep Structured Semantic Model,DSSM)和向量相似度模型(Vector Similarity Mod-el,VSM)两个实体排序模型上验证了特征文本选取方法的效果.结果显示特征文本筛选提高了DSSM上排序准确性,在P@3、P@5和P@10上分别有12.2%、12.3%和12.2%的提高.其中特殊字符处理对VSM有5.5%的提高.实验结果表明,对特征文本进行合理的筛选及清洗,有助于提高实体消岐中候选实体排序步骤的效果.
关键词:实体消歧特征文本数据清洗
分类号:TP391(计算技术、计算机技术)
资助基金:国家自然科学基金(61472436)国家自然科学基金(61532001)国家自然科学基金(61303190)
论文发表日期:2017-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:5( 1543-1547 )
英文信息
