DOI：10.3969/j.issn.1006-4222.2015.19.154

网页正文信息抽取新方法

引用

摘要：

随着社会的快速发展与互联网时代的到来，Web页面上所包含的信息已经是包罗万象，而面对如此海量的信息资源，我们要如何有效快速的检索并提取对我们有价值的信息资源已经成为对Web研究的一个重要命题。而基于信息抽取方法只能够处理一种特定的信息资源，并且对网页的依懒性较强，因此，在此提出一种将标点符号与HTML树结构相结合，作为网页识别正文内容的分析方法。其后通过对标点符号进行数据统计从而确定部分的正文信息，再根据正文信息的结构来确定其他信息内容。经此实验该提取方法能够有效的提取网页正文并屏蔽网页噪音。而且其普及性和准确性都比较高，在此本文将对网页正文提取信息进行探索。

关键词：网页正文、信息抽取、HTML树、方法

分类号：TP391.1(计算技术、计算机技术)

在线出版日期：2015-10-22（万方平台首次上网日期，不代表论文的发表时间）

页数：共2页

页码：210-211

期刊专题