10.3969/j.issn.1000-3428.2012.11.086
一种Deep Web爬虫爬行策略
Deep Web包含丰富的、高质量的信息资源,由于没有直接指向Deep Web页面的静态链接,目前大多搜索引擎不能发现这些页面,只能通过填写表单提交查询获取.为此,提出一种Deep Web爬虫爬行策略.用网页分类器的分层结果指导链接信息提取器提取有前途的链接,将爬行深度限定在3层,从最靠近查询表单中提取链接,且只提取属于这3个层次的链接,从而减少爬虫爬行时间,提高爬虫的准确度,并设计聚焦爬行算法的约束条件.实验结果表明,该策略可以有效地下载Deep Web页面,提高爬行效率.
Deep Web页面、反馈机制、爬行策略、聚焦爬虫、网络数据库、分类器
38
TP393(计算技术、计算机技术)
四川省教育厅科研基金资助项目10ZB023
2012-09-29(万方平台首次上网日期,不代表论文的发表时间)
共3页
284-286