10.3969/j.issn.1006-2475.2015.09.018
基于本体思想的网页信息抽取方法
为了抽取特定主题的网页信息,本文提出一种基于本体思想衡量主题相关度,以提高网页信息抽取质量的方法。该方法采用向量空间模型,结合特征词权值,利用本体思想分析并计算主题相关度,从而达到提高特定主题的网页信息抽取质量的目的。该方法不但简化了向量空间模型的维度计算,而且扩展了语义范围。最后采用一个分层体系结构的实际应用系统来演示该方法的实现过程。实际应用结果表明,该方法较准确抽取了特定主题的网页信息,同时降低了系统运算复杂度,提高了网页信息抽取的查全率和查准率,减少了网页信息的遗漏,提高了网页信息抽取的质量。
本体、网页信息抽取、相关度、爬虫、Web
TP391(计算技术、计算机技术)
2015-10-13(万方平台首次上网日期,不代表论文的发表时间)
共5页
90-94