10.3969/j.issn.1000-582X.2007.06.019
一种新型的文本无监督特征选择方法
结合文档频数DF(Document Frequency)和特征相似度FS(Feature Similarity)方法,提出一种新的无监督特征选择方法DFFS.该方法利用文档频数过滤掉90%的特征之后,再借助特征相似度移除尽可能多的冗余特征.采用K-均值方法,对比DFFS方法与其他3种常用特征选择方法(DF,TC,TS)的聚类性能.实验一:当特征数量由6 000减少到1 047时,DF方法的聚类性能急剧下降,而DFFS方法则有提高,甚至当特征数量进一步减少到350时,DFFS方法也没有下降.实验二:在保持10%~2%的特征时,DFFS方法优于其他3种方法,特别是在只保留2%的特征时,DFFS方法的明显优于其他方法.
自然语言处理、特征选择、文档频数、单词权、单词熵
30
TP181(自动化基础理论)
国家自然科学基金60173060;重庆市高等教育教学改革研究项目0635207
2007-07-30(万方平台首次上网日期,不代表论文的发表时间)
共4页
77-79,83