10.3969/j.issn.1672-9722.2020.06.001
结合文本语义图和词频统计的网页分类算法研究
为解决网页分类算法中仅考虑文本内容或仅考虑词义本身而引起的角度过于单一的问题,提出一种在文本语义图的基础上加入对文本词语频次考察的网页分类算法.首先通过词林相似度和相关性挖掘两种方式构建文本语义图,满足算法对文本词义相似性和相关性两方面的考察要求,引入PageRank算法计算词语词义权重值.然后对词频做统计,充分考虑词语在类内文本空间和整个文本空间的分布,对IDF算法进行改进,得到词频权重值.结合两种方式得到最终特征向量,进行网页分类.
网页分类、文本语义图、PageRank、IDF
48
TP391.1(计算技术、计算机技术)
国家自然科学基金项目;江苏省研究生科研与实践创新计划项目
2020-08-13(万方平台首次上网日期,不代表论文的发表时间)
共5页
1265-1268,1313