10.3969/j.issn.1000-1220.2005.11.016
一种基于磁盘的大数据集快速异常检测算法
异常点检测是数据挖掘的一个重要研究方向,基于Cell的异常点检测算法生成的Cell(单元)数与维数成指数增长.当生成的单元数增多及数据量增大时,基于Cell的算法不能有效工作.分析发现这些单元中存在很多无用的空单元.本文采用CD-Tree结构对非空单元进行索引,并采用聚簇技术,将每个单元中的数据点存放在同一个磁盘页链中.实验表明,采用CD-Tree以及聚簇技术设计的异常点检测磁盘算法的效率,以及所能处理的数据集维数较原基于Cell的磁盘算法都有显著的提高.
数据挖掘、异常点检测、CD-Tree、聚簇
26
TP311.13(计算技术、计算机技术)
国家自然科学基金60173051
2005-12-01(万方平台首次上网日期,不代表论文的发表时间)
共4页
1938-1941