DOI：10.3969/j.issn.1001-0645.2006.07.007

基于统计分布与集合论的文本分类方法

引用

摘要：

指出基于TfIdf的常用文本特征提取方法在文本分类问题中的缺陷,进而提出使用特征词的分布状态、词频和文本频三者相结合的方式提取文本特征的观点,给出了计算特征词权重的新方法,提出了新的文本分类方法. 试验表明,该方法能够最大限度保留文本的特征,并且可有效避免向量空间模型中的维数灾难问题,能应用于大规模文本分类.

关键词：文本分类、特征词、词频、文本频、统计分布

所属期刊栏目：26

分类号：TP391.3(计算技术、计算机技术)

资助基金：高等学校博士学科点专项科研项目20050007023

在线出版日期：2006-08-24（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：589-592,597

英文信息展示

期刊专题