DOI：10.3969/j.issn.1003-0077.2022.01.007

基于预训练语言模型的商品属性抽取

引用

摘要：

属性抽取是构建知识图谱的关键一环,其目的是从非结构化文本中抽取出与实体相关的属性值.该文将属性抽取转化成序列标注问题,使用远程监督方法对电商相关的多种来源文本进行自动标注,缓解商品属性抽取缺少标注数据的问题.为了对系统性能进行精准评价,构建了人工标注测试集,最终获得面向电商的多领域商品属性抽取标注数据集.基于新构建的数据集,该文进行多组实验并进行实验结果分析.特别地,基于多种预训练语言模型,进行了领域内和跨领域属性抽取.实验结果表明,预训练语言模型可以较好地提高抽取性能,其中ELECTRA在领域内属性抽取表现最佳,而在跨领域实验中BERT表现最佳.同时,该文发现增加少量目标领域标注数据可以有效提高跨领域属性抽取效果,增强了模型的领域适应性.

关键词：属性抽取、远程监督、预训练语言模型、跨领域学习

所属期刊栏目：36

分类号：TP391(计算技术、计算机技术)

资助基金：国家自然科学基金61876115

在线出版日期：2022-05-07（万方平台首次上网日期，不代表论文的发表时间）

页数：共9页

页码：56-64

英文信息展示

期刊专题