基于Hash结构词典的逆向回溯中文分词技术研究
为了提高现有的中文分词效率,提出了基于Hash结构词典的逆向回溯中文分词方法.针时首字Hash结构词典的不足,设计了能够记录词长的Hash结构尾字词典,然后对逆向最大匹配分词算法进行了分析,为了解决其存在的中文分词歧义问题,设计出一种逆向回溯最大匹配算法,该改进算法采用的回溯机制能够有效消除分词中可能存在的一些歧义问题.实验结果表明,该方法实现了提高中文分词速度并减少交集型歧义字符串切分错误的设计目标.
中文分词、哈希结构、尾字词典、逆向最大匹配算法、分词歧义、逆向回溯算法
31
TP391(计算技术、计算机技术)
湖北省教育厅科研基金项目D200618003
2011-03-16(万方平台首次上网日期,不代表论文的发表时间)
共4页
5158-5160,封3