基于联合模型的中文社交媒体命名实体识别
易黎1
黄鹏2
彭艳兵1
程光3
1.南京烽火软件科技有限公司 南京 2100192.南京烽火软件科技有限公司 南京 210019;武汉邮电科学研究院 武汉 4300743.东南大学计算机科学与工程学院 南京 210096
摘要:随着互联网的发展,对中文社交媒体中命名实体进行识别具有重要的意义,传统的做法是采用监督学习方法,局限于标注数据的稀缺.然而,通用领域中有足够的语料库且社交媒体中的海量未标注的文本可以用于提高命名实体识别的效果.论文提出了一个联合模型,利用通用领域语料库和社交网络领域中未标注的文本进行训练.该联合模型由两个模型组成,一个是跨领域学习模型另外一个是半监督学习模型.跨领域学习基于领域的相似性学习通用领域的信息.半监督学习通过主动学习目标域内未标注的信息.该联合模型提高了命名实体识别的效果,且大大减小了人工标注语料工作.
关键词:命名实体识别社交媒体跨领域学习领域相似性半监督学习主动学习
分类号:TP391(计算技术、计算机技术)
资助基金:国家高技术研究发展计划(863计划)(2015AA015603)国家自然科学基金(61602114)
论文发表日期:2017-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 2402-2406,2433 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2017,45(12)
所属栏目:系统结构