一种改进的基于二元统计的HMM分词算法
田思虑1
李德华1
潘莹2
1.华中科技大学图像识别与人工智能研究所,武汉,4300742.华中科技大学图像识别与人工智能研究所,武汉,430074;广西大学信息网络中心,南宁,530004
摘要:中文分词是中文信息处理的基础.基于二元统计的HMM中文分词算法表现良好,但也存在易将包含常用介、副词的词进行误拆分的问题.改进的分词算法运用逆向最大匹配的思想,在计算粗分集权重的过程中,考虑了分词的词长及词序对正确切分的有利影响.该算法首先计算出二元统计粗分模型有向边的权值,然后根据词长修定权值,最后运用最短路径法求出分词结果.实验结果表明,该算法有效的解决了过分拆分的问题,分词效果良好.
关键词:中文分词逆向最大匹配二元统计模型HMM模型
分类号:TP311(计算技术、计算机技术)
论文发表日期:2011-01-01
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:4( 14-16,20 )
英文信息展开
计算机与数字工程

计算机与数字工程

CSTPCD
ISSN:1672-9722
年,卷(期):2011,39(1)
所属栏目:算法与分析