10.3969/j.issn.1009-3044.2009.36.208
文本分类算法中词语权重计算方法的改进
在自动文本分类中,TFIDF公式是常用的词语权重计算公式.该方法简单易行,但仅仅考虑了特征词出现的频率,而忽略了特征词对区分每个类的贡献.针对这个不足,该文提出了TFIDF-CHI,来修正各个特征词的权重,重新调整每个特征词对各个类别的区分度,并用KNN分类器来验证其有效性.实验证明该方法优于原来的TFIDF算法,表明了改进的策略是可行的.
文本分类、特征权值、TFIDF、TFIDF-CHI
5
TP312(计算技术、计算机技术)
2010-03-30(万方平台首次上网日期,不代表论文的发表时间)
共3页
10626-10628