10.13266/j.issn.0252-3116.2014.20.019
针对爬虫的域名链接过滤算法
认为传统的基于主题的链接过滤算法虽然在某一领域的主题爬虫中使用广泛,但该方法只关心抓取的网页与主题之间的相关性,忽略了网站自身链接的结构特点.提出基于域名的链接过滤算法,该方法对基于网页链接中域名的结构特点进行比较,同时以基于主题的链接过滤算法作为辅助,判断出无用的垃圾链接.与单一基于主题的链接过滤算法相比较,基于域名的链接过滤算法的判断方式更为全面,链接过滤效率更高,从而能有效地提高网络爬虫的抓取效率和情报检索的效率.最后,通过仿真实验证明该算法的有效性.
网络爬虫、链接过滤、域名过滤、主题过滤
G350.7(情报学、情报工作)
2014-11-28(万方平台首次上网日期,不代表论文的发表时间)
125-130