10.3969/j.issn.1000-3428.2007.19.098
基于网页框架和规则的网页噪音去除方法
提出了一种基于网页框架和规则的网页去除噪音的新方法,该方法根据网页中HTML标签,<table>将网页分成若干部分,对各个table的长宽比属性进行比较,去掉长宽比很大的部分,并对其余table中的内容进行分析,根据内部是否存在和段落文字有关的标签<p>或<br>等来区分主题内容和噪音内容,在此基础上去除噪音内容.对来自CWT200G语料的132 559个网页进行测试后的结果表明,该方法可以有效地去除网页噪音,使索引文件减少约75%,大大地提高了检索速度,准确度也得到一定提高.
信息检索、网页噪音、页面框架
33
TP393(计算技术、计算机技术)
国家自然科学基金60373095
2007-12-17(万方平台首次上网日期,不代表论文的发表时间)
共3页
276-278