DOI：10.3969/j.issn.1006-9348.2020.08.097

基于K均值聚类的大数据频繁项集挖掘研究

引用

摘要：

针对传统大数据项集挖掘方法存在占用内存较多、挖掘效率较低的问题,提出新的基于K均值聚类的大数据频繁项集挖掘方法.通过对K均值聚类的区间标度变量、二元变量等相似度量的分析来表示样本之间的相似度与离散度,根据样本数据的不同属性选择对应矩阵类型;利用频繁项集自身的约束性质压缩空间,缩小挖掘范围;在K均值聚类基础上,采用fg-growth算法将目标数据高度压缩在fp-tree结构中,并命令原始聚类质心和数量,将其作为K均值的输入,实现大数据频繁项集挖掘.仿真结果证明,研究方法有效降低了挖掘计算复杂度,可保证在内存开销基本不变的情况下高效率挖掘大数据频繁项集.

关键词：频繁项集挖掘、样本相似度、准则函数、相似度阈值

所属期刊栏目：37

分类号：TP301(计算技术、计算机技术)

在线出版日期：2020-09-24（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：457-461

英文信息展示

期刊专题