基于深度学习与统计信息的领域术语抽取方法研究
万方数据知识服务平台
应用市场
我的应用
会员HOT
万方期刊
×

点击收藏,不怕下次找不到~

@万方数据
会员HOT

期刊专题

10.11871/jfdc.issn.2096-742X.2022.02.008

基于深度学习与统计信息的领域术语抽取方法研究

引用
[背景]及时掌握领域术语有助于动态把握领域发展方向,揭示领域的核心知识与研究热点.[目的]为提高领域术语抽取准确率,提出一种基于深度学习和统计信息的领域术语抽取方法.[方法]首先,对领域中文专利文本进行字嵌入表示,基于B E RT(Bidirectional Encoder Representations from Transformers)获取字符级的向量表征作为模型的输入;然后,利用BiLSTM-CRF(Bidirectional Long Short Term Memory-Conditional Random Field)深度学习模型提取序列化文本的语义特征,得到领域术语标注序列;最后,综合计算复合结构术语的互信息和左右熵,并结合领域知识库对抽取结果进行校正.[结果]模型在"盐湖提锂"领域进行实验,结果表明BERT-BiLSTM-CRF模型抽取该领域术语准确率达到77.33%,而对抽取结果进行校正进一步将准确率提升了3.68%,是一种有效的领域术语抽取方法.

领域术语抽取、BERT、双向长短时记忆网络、条件随机场、互信息、左右信息熵

4

TP391.1;TN762;TP181

中国科学院武汉文献情报中心前瞻性项目;青海省企业研究转化与产业化专项;青海省创新平台建设专项

2022-05-09(万方平台首次上网日期,不代表论文的发表时间)

共12页

87-98

相关文献
评论
相关作者
相关机构

专业内容知识聚合服务平台

国家重点研发计划“现代服务业共性关键技术研发及应用示范”重点专项“4.8专业内容知识聚合服务技术研发与创新服务示范”

国家重点研发计划资助 课题编号:2019YFB1406304
National Key R&D Program of China Grant No. 2019YFB1406304

©天津万方数据有限公司 津ICP备20003920号-1

信息网络传播视听节目许可证 许可证号:0108284

网络出版服务许可证:(总)网出证(京)字096号

违法和不良信息举报电话:4000115888    举报邮箱:problem@wanfangdata.com.cn

举报专区:https://www.12377.cn/

客服邮箱:op@wanfangdata.com.cn