10.3969/j.issn.1007-757X.2013.03.003
Web信息抽取系统的设计
为了获取分散Web页面中隐含信息,设计了Web信息抽取系统.该系统首先使用一种改进的HITS主题精选算法进行信息采集;然后对Web页面的HTML结构进行文档的数据预处理;最后,基于DOM树的XPath绝对路径生成算法来获取被标注结点的XPath表达式,并使用XPath语言结合XSLT技术来编写抽取规则,从而得到结构化的数据库或XML文件,实现了Web信息的定位和抽取.通过一个购物网站的抽取实验证明,该系统的抽取效果良好,可以实现相似Web页面的批量抽取.
Web信息抽取、主题精选、DOM树、XPath、XSLT
29
TP311(计算技术、计算机技术)
2012年咸阳市科学技术研究发展计划项目2012k03-05
2013-09-04(万方平台首次上网日期,不代表论文的发表时间)
共3页
8-10