用于短文本关键词抽取的TTM DMM主题翻译模型
王瑞1
秦永彬2
闫盈盈1
1.贵州大学计算机科学与技术学院 贵阳5500252.贵州大学计算机科学与技术学院 贵阳550025;贵州大学贵州省公共大数据重点实验室 贵阳550025
摘要:基于主题翻译模型的短文本关键词抽取方法,均采用LDA(Latent Dirichlet Allocation)主题模型作为主题发现方法,然而LDA在处理特征稀疏的短文本时,主题发现效果较差,使得当前的主题翻译模型存在不完善之处.论文通过将DMM(Dirichlet Multinomial Mixture)模型作为主题发现模型,结合统计机器翻译,提出了一种用于短文本关键词抽取的TTM DMM(Topical Translation Model based on Dirichlet Multinomial Mixture)主题翻译模型.该模型利用DMM模型发现短文本主题信息,在主题约束下学习词语与关键词的翻译概率,从而提高短文本关键词抽取效果.在真实数据集上的实验结果表明,论文提出的TTM DMM模型在评价指标Precious、Recall以及F-measure上优于现有的短文本关键词抽取方法.
关键词:集中不重复的关键词个数主题的个数
分类号:TP391.1(计算技术、计算机技术)
资助基金:国家自然科学基金(61540050)
论文发表日期:2018-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 945-949,955 )
英文信息
