DOI：10.16652/j.issn.1004-373x.2020.17.029

基于大数据挖掘技术的文本分类研究

全文直达

下载全文

在线阅读

引用

摘要：

文本数据具有规模大、特征维数高等特点,当前文本分类方法无法刻画文本变化特点,使得文本分类正确率低、误差大、分类时间长,为了获得理想的文本分类效果,设计基于大数据挖掘技术的文本分类方法.首先对当前文本分类的研究进展进行分析,找出导致当前文本分类效果差的原因;然后,提取文本分类原始特征,并引入核主成分分析算法对原始特征进行处理,降低特征维数,简化文本分类器的结构;最后,采用大数据挖掘技术构建文本分类器,并与其他文本分类方法进行对比测试.测试结果表明,所提方法可以更好地描述文本变化特点,能够对各种类型文本进行准确识别和分类,文本分类精度超过95％,明显高于当前其他文本分类方法,并且所提方法的文本分类时间显著减少,具有更好的文本分类效果.

关键词：大规模文本数据、高维特征、大数据挖掘技术、文本分类器、分类精度、分类时间

所属期刊栏目：43

分类号：TN911.1-34;TP391.9

在线出版日期：2020-09-24（万方平台首次上网日期，不代表论文的发表时间）

页数：共4页

页码：126-129

英文信息展示

期刊专题