DOI：10.16526/j.cnki.11-4762/tp.2019.07.028

针对微博的免登录分布式网络爬虫的研究

引用

摘要：

微博作为优质的数据源,其中的数据非常适合做舆情分析等;新浪官方提供的API限制数据采集速度,而利用模拟登录的网络爬虫采集数据又相对复杂且会降低效率;针对这些问题,设计了一个免登录的微博网络爬虫;通过实验表明,该爬虫可以更快的对微博数据进行完整稳定的采集;随着对数据需求量越来越大,单机网络爬虫已经不足以满足要求,将Hadoop分布式计算平台与免登录爬虫相结合,设计了一个基于MapReduce的分布式网络爬虫系统,利用多台计算机组成的集群,实现短时间内免登录抓取海量微博数据;通过实验证明,该爬虫系统可以每天稳定抓取近千万条微博.

关键词：免登录网络爬虫、分布式网络爬虫、Hadoop、MapReduce

所属期刊栏目：27

分类号：TP391.3(计算技术、计算机技术)

资助基金：陕西省科技计划重点项目资助2017ZDCXL-GY-05-03

在线出版日期：2019-08-07（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：128-131,136

英文信息展示

期刊专题