10.3969/j.issn.1672-058X.2012.02.016
基于HMM的主题爬虫研究
主题爬虫是垂直搜索引擎的核心组成部分,它为面向主题的用户查询准备数据资源;提出了一种基于HMM的主题爬虫方法,方法不仅分析网页内容,而且还考虑网页的上下文链接结构,首先将当前网页的聚类结果作为观察状态、将当前网页到目标网页的链接距离作为隐含状态,然后通过HMM模型学习用户的主题浏览模式并利用它采集更多的主题网页;实验结果表明:方法能采集大量与指定主题相关的高质量网页,主题爬行效率优于Best-First主题爬虫。
主题爬虫、隐马尔科夫模型、向量空间模型、主题相关度、垂直搜索引擎
29
TP391(计算技术、计算机技术)
2012-05-05(万方平台首次上网日期,不代表论文的发表时间)
共7页
66-72