DOI：10.19734/j.issn.1001-3695.2017.05.0643

中文分词模型词典融入方法比较

引用

摘要：

基于统计的方法一般采用人工标注的句子级的标注语料进行训练,但是这种方法往往忽略了已有的经过多年积累的人工标注的词典信息.这些信息尤其是在面向跨领域时,由于目标领域句子级别的标注资源稀少,从而显得更加珍贵.因此,如何充分且有效地在基于统计的模型中利用词典信息是一个非常值得关注的工作.最近已有部分工作对它进行了研究,按照词典信息融入方式大致可以分为两类:一类是在基于字的序列标注模型中融入词典特征;另一类是在基于词的柱搜索模型中融入特征.对这两类方法进行比较,并进一步进行结合.实验表明,这两类方法结合之后,词典信息可以得到更充分的利用,最终无论是在同领域测试和还是在跨领域测试上都取得了更优的性能.

关键词：中文分词、条件随机场、柱搜索、领域自适应

所属期刊栏目：36

分类号：TP391(计算技术、计算机技术)

资助基金：北京市教委科技计划面上项目KM201411232012

在线出版日期：2019-05-31（万方平台首次上网日期，不代表论文的发表时间）

页数：共4页

页码：8-10,17

英文信息展示

期刊专题