DOI：10.3969/j.issn.1673-629X.2011.07.008

基于字分类的中文分词的研究

引用

摘要：

中文分词是白然语言处理的前提和基础,利用基于字分类的方法实现中文分词,就是将中文分词想象成字分类的过程.把字放入向前向后相邻两个字这样的一个语境下根据互信息统计将字分成四种类别,即跟它前面结合的字,跟它后面结合的字,跟它前后结合的字,独立的字.在分词的过程中采用了t-测试算法,一定程度上解决了歧义问题.以人民日报为语料库进行训练和测试,实验结果表明,该方法能够很好地处理歧义问题,分词的正确率达到了90.3%,有了明显的提高.

关键词：中文分词、互信息、t-测试、分类

所属期刊栏目：21

分类号：TP391.1(计算技术、计算机技术)

资助基金：云南省自然科学基金2007F174M;云南大学研究生科研课题资助项目ynny200928

在线出版日期：2011-11-11（万方平台首次上网日期，不代表论文的发表时间）

页数：共4页

页码：29-31,35

英文信息展示

期刊专题