DOI：10.3969/j.issn.1001-3695.2017.08.020

基于并行处理机制的数据复用策略研究

引用

摘要：

针对频繁出现的数据冗余、数据复用效率低下等问题,将列存储方式结合并行处理机制对数据复用策略进行优化.构建了基于MapReduce的数据复用并行化处理模型,利用改进型CSM模式匹配算法结合数据挖掘过程中的数据筛选算法,提出并行化数据复用算法.该算法利用数据属性的模式匹配确定属性列之间的对应关系,使用数据检测方式验证属性列数据复用的可行性,从而进行属性列数据筛选,实现并行化的数据复用策略.在大数据环境下的数据仓库中,对大规模基准数据属性集SSB和TPCH中提取的数据实证进行分析,实验结果分析中存储量和处理时间分别减少了17%和35%,验证了并行化数据复用策略在数据存储量、数据处理时间等方面比普通数据复用策略更具高效性.

关键词：并行处理、数据复用、数据仓库、模式匹配

所属期刊栏目：34

分类号：TP391(计算技术、计算机技术)

资助基金：国家自然科学基金资助项目71272191

在线出版日期：2017-08-16（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：2324-2328

英文信息展示

期刊专题