10.16526/j.cnki.11-4762/tp.2019.07.028
针对微博的免登录分布式网络爬虫的研究
微博作为优质的数据源,其中的数据非常适合做舆情分析等;新浪官方提供的API限制数据采集速度,而利用模拟登录的网络爬虫采集数据又相对复杂且会降低效率;针对这些问题,设计了一个免登录的微博网络爬虫;通过实验表明,该爬虫可以更快的对微博数据进行完整稳定的采集;随着对数据需求量越来越大,单机网络爬虫已经不足以满足要求,将Hadoop分布式计算平台与免登录爬虫相结合,设计了一个基于MapReduce的分布式网络爬虫系统,利用多台计算机组成的集群,实现短时间内免登录抓取海量微博数据;通过实验证明,该爬虫系统可以每天稳定抓取近千万条微博.
免登录网络爬虫、分布式网络爬虫、Hadoop、MapReduce
27
TP391.3(计算技术、计算机技术)
陕西省科技计划重点项目资助2017ZDCXL-GY-05-03
2019-08-07(万方平台首次上网日期,不代表论文的发表时间)
共5页
128-131,136