基于互信息改进算法的新词发现对中文分词系统改进

引用

摘要：

提出一种非监督的新词识别方法.该方法利用互信息(PMI)的改进算法——PMIk算法与少量基本规则相结合,从大规模语料中自动识别2～n元网络新词(n为发现的新词最大长度,可以根据需要指定).基于257MB的百度贴吧语料实验,当PMIk方法的参数为10时,结果精度达到97.39％,比PMI方法提高28.79％,实验结果表明,该新词发现方法能够有效地从大规模网络语料中发现新词.将新词发现结果编纂成用户词典,加载到汉语词法分析系统ICTCLAS中,基于10 KB的百度贴吧语料实验,比加载用户词典前的分词结果准确率、召回率和F值分别提高7.93％,3.73％和5.91％.实验表明,通过进行新词发现能有效改善分词系统对网络文本的处理效果.

关键词：新词识别、未登录词、互信息、PMI改进算法、中文分词

所属期刊栏目：52

分类号：TP391(计算技术、计算机技术)

资助基金：国家自然科学基金61373116;陕西省普通高等学校重点学科专项资金112-1602;西安邮电大学研究生创新基金ZL2013-31

在线出版日期：2017-01-18（万方平台首次上网日期，不代表论文的发表时间）

页数：共6页

页码：35-40

英文信息展示

期刊专题