DOI：10.3969/j.issn.1002-137X.2007.10.033

基于页面标签的Web结构化数据抽取

引用

摘要：

本文研究了从data intensive类型的Web页面中提取结构化数据的问题,提出了基于页面标签的数据抽取算法.该算法先根据标签的显示位置及其大小判断不同标签元素之间的嵌套关系,并构造简化的HTML树SimHTree,有效地减少了识别数据记录的时间.在此基础上,提出子串匹配调整算法,对数据记录进行识别,标识数据项.实验表明,该算法是有效的.

关键词：Web数据抽取、Web挖掘、结构化数据、信息抽取

所属期刊栏目：34

分类号：TP3(计算技术、计算机技术)

资助基金：国家自然科学基金50474033;福建省自然科学基金A0310008;福建省科技计划2003H043

在线出版日期：2007-12-10（万方平台首次上网日期，不代表论文的发表时间）

页数：共4页

页码：133-136

英文信息展示

期刊专题