10.3969/j.issn.1000-3428.2010.04.014
一种改进的基于本体的Web信息抽取
以Web页面信息项本体定义为基础,对单个样本页面信息项路径进行启发式学习,对所有样本页面集中信息块路径进行归纳学习,识别结构相似的信息块子树位置,以准确划定信息抽取区域,降低页面噪声.将经过噪声处理的样本页面自动解析成页面的结构本体.比较Web页面信息项本体和页面的结构本体,通过归纳学习算法生成抽取规则,提高Web信息的抽准率.
信息抽取、本体、归纳学习、文档对象模型
36
N945(系统科学)
湖南省教育厅科研基金资助项目09C297,07C032
2010-04-20(万方平台首次上网日期,不代表论文的发表时间)
共4页
39-41,44