DOI：10.3772/j.issn.1000-0135.2012.01.005

分块布局下的主题型网页的内容抽取

引用

摘要：

本篇论文以去除网页噪声,整合网页内容为目标,提出了面向主题型网页,根据网页规划布局抽取网页内容的方法.算法首先分析原始网页的DOM结构生成标签树,再根据标签分类和对应节点的信息对标签树自底向上进行划分,并依据划分块的文字密度,链接密度及图片密度,分类信息块.进一步,提炼网页主题的文本特征向量,采用基于词条空间的文本相似度计算,获取划分块的主题相关度,以主题相关度为量化基准剔除噪声,识别网页主旨内容,重构页面描述.这一算法被应用于面向人才资讯的信息采集项目中,实验表明,算法适用于主题型网页的"去噪"及内容提取,具体应用中有较理想的表现.

关键词：网页内容抽取、网页分块、网页去噪

所属期刊栏目：31

分类号：TP3;G25

资助基金：2008年度教育部人文社会科学研究项目"基于信息抽取的数字图书馆的知识获取研究"项目批准号08JC870013 及2009年度中山大学青年教师培育项目"智能化深度搜索引擎实现技术的研究"2000-3161101

在线出版日期：2012-02-27（万方平台首次上网日期，不代表论文的发表时间）

页数：共9页

页码：31-39

英文信息展示

期刊专题