基于BERT+BiLSTM+CRF深度学习模型和多元组合数据增广的渔业标准命名实体识别

引用

摘要：

为解决渔业标准命名实体识别任务中部分实体语料分布稀疏导致的效果不佳问题,提出了基于多元组合数据增广(data augmentation method based on multiple combination,MCA)的渔业标准命名实体识别方法,该方法融合了基于领域词典的联合替换算法(joint replacement algorithm based on domain dictionary,DDR)、基于槽点保护的随机删除算法(random deletion algorithm based on slot protection,SPD)和基于槽点保护的随机插入算法(random insertion algorithm based on slot protection,SPI)进行语料库的数据增广,首先构建"水产品名称"同类词词典和领域同义词词典,通过两个词典分别对"水产品名称"类实体和随机词进行同类词替换和同义词替换,生成新的句子,以增加目标实体数量和句子的多样性,然后在基于槽点保护的情况下对原句子分别进行随机删除和随机插入操作,在保留实体及上下文特征的情况下进一步丰富语料的多样性,提高模型的泛化能力.结果表明,采用基于融合注意力机制的BERT+BiLSTM+CRF网络模型和多元组合数据增广方法进行渔业标准命名实体识别,准确率、召回率、F1值分别达到了91.73％、88.64％、90.16％,具有较好的效果.研究表明,基于多元组合数据增广的渔业标准命名实体识别方法有效解决了部分实体样本稀疏问题,提升了渔业标准命名实体识别的整体效果.

关键词：深度学习;实体识别;数据增广;BERT;双向长短时记忆网络;渔业标准

所属期刊栏目：36

分类号：S932.2;TP391(水产资源)

资助基金：设施渔业教育部重点实验室开放课题;辽宁省重点研发计划项目;国家自然科学基金

在线出版日期：2021-09-23（万方平台首次上网日期，不代表论文的发表时间）

页数：共9页

页码：661-669

英文信息展示

期刊专题