10.3969/j.issn.1000-1220.2019.07.024
一种面向医学文本数据的结构化信息抽取方法
医学文本作为医疗领域重要的信息载体,为临床诊断和病理学研究提供了重要的数据支持,然而使用自然语言编写的文本数据往往是非结构化的,不便于机器理解和自动化处理.对于中文的医学文本数据而言,由于专业性强,需要丰富的领域知识,并且语法上多采用短句形式,这给结构化信息的抽取带来了巨大的挑战.为此,本文设计了一种针对医学领域的文本数据进行结构化信息抽取的方法,该方法首先通过文本聚类和关键词提取来获得医学描述语言中常用的表达术语,然后使用生成的医学术语库辅助中文分词处理,以提高中文医学文本的分词质量.然后,分析词与词之间的语义依存关系并随之构建依存句法树.最后,从该句法树中识别和抽取医学文本描述中的关键指标及其对应的指标值,最终得到结构化的键值对数据.本文采用真实的医学影像报告文本作为实验数据,实验结果表明该方法有效提高了中文医学文本的分词质量,准确率最高可达98. 24% ,并在结构化的信息抽取中效果显著,具有最高83. 76%的准确率和88. 09%的召回率.本文提出的方法能覆盖多种依存语法,且有很好的适用性.
结构化信息抽取、文本聚类、关键词提取、语义依存
40
TP311(计算技术、计算机技术)
国家重点研究发展计划项目2018YFB1003404;国家自然科学基金项目61672142,61402213,U1435216;中央大学基础研究基金项目N150408001-3,N150404013
2019-07-25(万方平台首次上网日期,不代表论文的发表时间)
共7页
1479-1485