10.3969/j.issn.1000-3428.2014.07.032
基于迭代算法的新词识别
新词识别是中文信息处理的重要基础,但中文字符极强的构词能力给新词检测带来较大困难。受对偶原理的启发,提出一种基于迭代算法的新词识别算法。对目标语料进行分词和词性标注,通过两遍扫描进行字符串统计并提取重复模式。结合词语结构的特征,迭代使用重复模式互信息、左(右)熵,左(右)邻右(左)平均熵等特征进行新词识别,获得候选新词列表。利用中文词语搭配库对候选新词列表进行最后一次过滤得到最终新词列表。实验结果表明,利用该方法进行新词识别,P@10值达到100%,P@100值提高至90%,左(右)邻右(左)平均熵可在一定程度上提高新词识别的准确率。
对偶原理、新词识别、迭代算法、信息熵、重复模式、中文词语搭配库
TP18(自动化基础理论)
国家自然科学基金资助项目61272362。
2014-08-12(万方平台首次上网日期,不代表论文的发表时间)
共6页
162-167