10.14188/j.1671-8836.2016.06.011
中文文本中实体数值型关系无监督抽取方法
中文实体间的数值型关系抽取有着广泛的应用前景,目前常用的实体关系抽取一般采用有监督抽取方法,且多用于短文本和简单句,并不适合处理海量复杂句.针对来自于网络的大量复杂文本,本文提出了一种中文实体数值型关系的无监督抽取方法.在中文分词、词性标注等自然语言处理结果的基础上,首先经过句式分析并采用选择树算法构建候选集,接着利用Jaro-Winkler距离进行候选集筛选,最后抽取得到数值型三元组关系.本文在钢铁、船舶、房地产3个行业的数据上进行了实验,结果表明,该方法抽取中文实体数值型关系是有效的.
实体关系抽取、无监督、数值型三元组、信息抽取
62
TP391(计算技术、计算机技术)
国家社会科学基金重大项目11&ZD189;湖北省自然科学基金面上项目2015CFB564;湖北省教育厅科学技术研究计划指导性项目B2016010资助
2017-01-07(万方平台首次上网日期,不代表论文的发表时间)
552-560