10.3969/j.issn.1000-3428.2010.08.100
基于共现词查询的主题爬虫研究
通过建立一个共现词库改进主题模型,以提高下载网页的主题相关度及质量,并且能描述其语境的上下文,揣测用户意图,调节检索结果排序.在此基础上设计并实现一个FDC主题爬虫系统,该系统采用改进的主题敏感FDC-PageRank算法来计算网页优先级.实验表明其效果良好.
主题爬虫、共现词、FDC主题模型、FDC_Topic、Sensitive PageRank算法
36
TP311.5(计算技术、计算机技术)
2010-05-31(万方平台首次上网日期,不代表论文的发表时间)
共3页
286-288