DOI：10.3969/j.issn.1001-0548.2013.01.024

有效的爬行Ajax页面的网络爬行算法

引用

摘要：

Ajax页面的生成和页面导航需要执行客户端的JavaScript代码,传统网络爬行算法无法获取Ajax页面全部内容.分析了Ajax的工作方式,阐述了爬行Ajax网页所面临的主要问题,提出并实现了一种有效爬行Ajax页面的网络爬行算法.该算法可控制客户端浏览器动态生成页面内容和完成页面导航,为爬行过的页面分配标识编号并生成相应静态页面.实验结果表明,提出的算法所爬行的Ajax页面数量明显多于传统方法,同时,采用的双重消重策略可有效减少算法的时间耗费.

关键词：Ajax、爬行算法、消重策略、搜索引擎

分类号：TP393.08(计算技术、计算机技术)

在线出版日期：2013-04-03（万方平台首次上网日期，不代表论文的发表时间）

页数：共6页

页码：115-120

英文信息展示

期刊专题