SparkSql上自适应数据集的高效频繁集挖掘算法

引用

摘要：

针对基于Spark框架的关联规则算法存在I/O开销大、数据结构和挖掘频繁集方式单一、计算支持度的方式效率低等问题,提出基于SparkSql进行分布式编程的算法.将数据集加载到DataFrame,利用改进后的布隆过滤器高效存储频繁集挖掘过程中产生的项集,解决RDD内存资源和计算速度受限问题.基于先验定理对事务、项目和项集进行精简,同时提出用Sql语句对项集中项目对应事务集合求交集的方式计算项集支持度,提高计算支持度的效率.提出了两种迭代算法和自适应数据的选择条件,增强该算法对各种数据集的泛化性.进行多组实验,证明提出的算法总是自适应本次迭代数据的特点选择最优的迭代方法,同时具有较高并行算法性能,可以扩展到更大规模集群和数据;同基于Spark框架的关联规则算法YAFIM和R-Apriori进行对比,在每次迭代和总体运行计算效率上有更好的表现.

关键词：频繁集、大数据、候选集、自适应数据、布隆过滤器、SparkSql

所属期刊栏目：56

分类号：TP311.1(计算技术、计算机技术)

资助基金：国家自然科学基金;国家自然科学基金青年基金

在线出版日期：2020-11-12（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：72-78

英文信息展示

期刊专题