DOI：10.3969/j.issn.1000-7024.2007.08.003

基于频繁词集聚类的海量短文分类方法

引用

摘要：

信息技术的飞速发展造成了大量的文本数据累积,其中很大一部分是短文本数据.文本分类技术对于从这些海量短文中自动获取知识具有重要意义.但是对于关键词出现次数少的短文,现有的一般文本挖掘算法很难得到可接受的准确度.一些基于语义的分类方法获得了较好的准确度但又由于其低效性而无法适用于海量数据.针对这个问题提出了一个新颖的基于频繁词集聚类的短文分类算法.该算法使用频繁词集聚类来压缩数据,并使用语义信息进行分类.实验表明该算法在对海量短文进行分类时,其准确度和性能超过其它的算法.

关键词：文本挖掘、分类、海量、短文、频繁词集

所属期刊栏目：28

分类号：TP18(自动化基础理论)

资助基金：国家高技术研究发展计划863计划2004AA112020;2003AA115210;2003AA111020

在线出版日期：2007-05-28（万方平台首次上网日期，不代表论文的发表时间）

页数：共4页

页码：1744-1746,1780

英文信息展示

期刊专题