DOI：10.3969/j.issn.1000-3428.2012.11.086

一种Deep Web爬虫爬行策略

引用

摘要：

Deep Web包含丰富的、高质量的信息资源,由于没有直接指向Deep Web页面的静态链接,目前大多搜索引擎不能发现这些页面,只能通过填写表单提交查询获取.为此,提出一种Deep Web爬虫爬行策略.用网页分类器的分层结果指导链接信息提取器提取有前途的链接,将爬行深度限定在3层,从最靠近查询表单中提取链接,且只提取属于这3个层次的链接,从而减少爬虫爬行时间,提高爬虫的准确度,并设计聚焦爬行算法的约束条件.实验结果表明,该策略可以有效地下载Deep Web页面,提高爬行效率.

关键词：Deep Web页面、反馈机制、爬行策略、聚焦爬虫、网络数据库、分类器

所属期刊栏目：38

分类号：TP393(计算技术、计算机技术)

资助基金：四川省教育厅科研基金资助项目10ZB023

在线出版日期：2012-09-29（万方平台首次上网日期，不代表论文的发表时间）

页数：共3页

页码：284-286

英文信息展示

期刊专题