DOI：10.3969/j.issn.1007-757X.2013.03.003

Web信息抽取系统的设计

引用

摘要：

为了获取分散Web页面中隐含信息,设计了Web信息抽取系统.该系统首先使用一种改进的HITS主题精选算法进行信息采集；然后对Web页面的HTML结构进行文档的数据预处理；最后,基于DOM树的XPath绝对路径生成算法来获取被标注结点的XPath表达式,并使用XPath语言结合XSLT技术来编写抽取规则,从而得到结构化的数据库或XML文件,实现了Web信息的定位和抽取.通过一个购物网站的抽取实验证明,该系统的抽取效果良好,可以实现相似Web页面的批量抽取.

关键词：Web信息抽取、主题精选、DOM树、XPath、XSLT

所属期刊栏目：29

分类号：TP311(计算技术、计算机技术)

资助基金：2012年咸阳市科学技术研究发展计划项目2012k03-05

在线出版日期：2013-09-04（万方平台首次上网日期，不代表论文的发表时间）

页数：共3页

页码：8-10

英文信息展示

期刊专题