10.3969/j.issn.1001-0548.2013.01.024
有效的爬行Ajax页面的网络爬行算法
Ajax页面的生成和页面导航需要执行客户端的JavaScript代码,传统网络爬行算法无法获取Ajax页面全部内容.分析了Ajax的工作方式,阐述了爬行Ajax网页所面临的主要问题,提出并实现了一种有效爬行Ajax页面的网络爬行算法.该算法可控制客户端浏览器动态生成页面内容和完成页面导航,为爬行过的页面分配标识编号并生成相应静态页面.实验结果表明,提出的算法所爬行的Ajax页面数量明显多于传统方法,同时,采用的双重消重策略可有效减少算法的时间耗费.
Ajax、爬行算法、消重策略、搜索引擎
TP393.08(计算技术、计算机技术)
2013-04-03(万方平台首次上网日期,不代表论文的发表时间)
共6页
115-120