DOI：10.3969/j.issn.1003-0077.2019.05.015

基于词向量预训练的不平衡文本情绪分类

引用

摘要：

深度学习中处理不平衡问题的方法多为代价敏感和采样.该文在词向量迁移的基础上提出预训练任务选择方法.用利于小类别区分的预训练词向量来初始化目标模型,并结合均衡过采样充分利用样本信息保持模型在大类别上的精度,使模型提取的文本特征在大小类别上具有公平性,从特征层面实现了平衡效果.实验结果表明,在文本情绪分类任务中,对比过采样方法,该方法在大部分无严重过拟合情况下有更好的平衡效果.当存在较严重过拟合时,该方法在目标分类数为三时平衡效果显著,并通过实验验证了预训练方法可与代价敏感方法相结合提升平衡性能.

关键词：不平衡分类、情绪分类、均衡过采样、预训练词向量

所属期刊栏目：33

分类号：TP391(计算技术、计算机技术)

资助基金：NSFC -通用技术基础研究联合基金U1636111;国家自然科学基金61761166005;宁波市科技计划项目2017C50018 ,2016D10016

在线出版日期：2019-06-13（万方平台首次上网日期，不代表论文的发表时间）

页数：共11页

页码：132-142

英文信息展示

期刊专题