DOI：10.3969/j.issn.1001-3695.2010.03.018

基于内码序值聚类的相似重复记录检测方法

引用

摘要：

检测和消除相似重复记录是数据清理和提高数据质量要解决的关键问题之一,针对相似重复记录问题,提出了基于内码序值聚类的相似重复记录检测方法.该方法先选择关键字段或字段某些位,根据字符的内码序值,利用聚类思想将大数据集聚集成多个小数据集;然后,通过等级法计算各字段的权值,并将其应用在相似重复记录的检测算法中;最后,在各个小数据集中检测和消除相似重复记录.为避免关键字选择不当而造成记录漏查问题,采用多趟检测方法进行多次检测.通过实验表明,该方法具有较好的检测精度和时间效率,能很好地应用到中英文字符集,通用性很强,并能够有效地解决大数据量的相似重复记录检测问题.

关键词：相似重复记录、内码序值、聚类、等级法

所属期刊栏目：27

分类号：TP311(计算技术、计算机技术)

资助基金：国家火炬计划资助项目2004EB33006[0];江苏省高校自然科学指导性计划资助项目05JKD520050

在线出版日期：2010-05-04（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：874-878

英文信息展示

期刊专题