10.3969/j.issn.1001-3695.2017.08.020
基于并行处理机制的数据复用策略研究
针对频繁出现的数据冗余、数据复用效率低下等问题,将列存储方式结合并行处理机制对数据复用策略进行优化.构建了基于MapReduce的数据复用并行化处理模型,利用改进型CSM模式匹配算法结合数据挖掘过程中的数据筛选算法,提出并行化数据复用算法.该算法利用数据属性的模式匹配确定属性列之间的对应关系,使用数据检测方式验证属性列数据复用的可行性,从而进行属性列数据筛选,实现并行化的数据复用策略.在大数据环境下的数据仓库中,对大规模基准数据属性集SSB和TPCH中提取的数据实证进行分析,实验结果分析中存储量和处理时间分别减少了17%和35%,验证了并行化数据复用策略在数据存储量、数据处理时间等方面比普通数据复用策略更具高效性.
并行处理、数据复用、数据仓库、模式匹配
34
TP391(计算技术、计算机技术)
国家自然科学基金资助项目71272191
2017-08-16(万方平台首次上网日期,不代表论文的发表时间)
共5页
2324-2328