10.3969/j.issn.1003-3254.2009.07.041
基于JavaScript切片的AJAX框架网络爬虫技术研究
自Jesse James Garrett提出了AJAX概念以来,由于AJAX在提升用户交互体验的同时,又不需要在客户端安装插件.因此,一经提出就引起了互联网领域的广泛关注.但目前的网络爬虫技术在AJAX框架的URL解析过程中存在着不能够识别事件触发顺序等问题,导致大量数据不能被搜索引擎有效检索.本文针对此问题,通过研究基于对象的程序切片算法,以及脚本执行引擎与切片模块的互操作,最终解决AJAX框架中URL提取以及异步JavaScript网络爬虫系统的关键技术问题.
JavaScript、程序切片、网络爬虫、有限状态机、AJAX
18
TP3;TH1
中国科学院知识创新工程重要方向项目KGCX2-SW-511
2009-07-10(万方平台首次上网日期,不代表论文的发表时间)
共4页
169-171,137