10.3969/j.issn.1000-5641.2017.05.002
支持非等值连接的分布式数据流处理系统
实时处理的分布式数据流系统在当今大数据时代扮演着越来越重要的角色.其中,连接查询是大数据分析处理中最为重要且开销较大的操作之一.然而,由于现实应用产生的数据普遍存在倾斜分布现象,加之数据流本身的无界性与不可预知性,给在分布式数据流系统上进行连接查询处理提出了严峻的挑战.目前工业界较为主流的数据流系统处理连接查询的通用性较低,没有提供专门针对连接操作的接口;学术界推出的数据流连接查询原型系统虽然提供了接口,但大多面向等值连接,或仅能支持部分theta连接,且存在资源开销大、负载均衡性能低等问题.本文对比分析三种典型数据流系统,将基于Join-Matrix的连接处理技术与Storm系统相结合,设计并实现了通用的、可支持任意连接查询的数据流处理系统.实验展示了本文设计的系统具有更加良好的吞吐量与资源优化表现.
数据流处理系统、连接处理、分布式计算
TP391(计算技术、计算机技术)
国家大学生创新创业训练计划20160269127;国家自然科学基金61232002;国家863计划2015AA015307;国家自然基金委项目61672233
2017-12-06(万方平台首次上网日期,不代表论文的发表时间)
共9页
11-19