10.3969/j.issn.1002-137X.2007.10.033
基于页面标签的Web结构化数据抽取
本文研究了从data intensive类型的Web页面中提取结构化数据的问题,提出了基于页面标签的数据抽取算法.该算法先根据标签的显示位置及其大小判断不同标签元素之间的嵌套关系,并构造简化的HTML树SimHTree,有效地减少了识别数据记录的时间.在此基础上,提出子串匹配调整算法,对数据记录进行识别,标识数据项.实验表明,该算法是有效的.
Web数据抽取、Web挖掘、结构化数据、信息抽取
34
TP3(计算技术、计算机技术)
国家自然科学基金50474033;福建省自然科学基金A0310008;福建省科技计划2003H043
2007-12-10(万方平台首次上网日期,不代表论文的发表时间)
共4页
133-136