10.3969/j.issn.1003-3254.2011.11.013
基于多维语义的互联网药品信息提取方法
提出了基于多维语义的互联网药品信息提取方法,构建语义词典通过从多个维度对互联网药品知识进行描述,克服了不同来源网页之间的异构性并找出了其隐藏的共性.同时,采用了基于结构语义熵的方法对目标网页信息聚集区域进行定位,从中提取感兴趣的药品信息.最后再通过语义词典对提取的信息进行验证并自动生成XPath提取规则进行补充.该方法能够自动有效地从互联网的多个信息来源获取药品信息,实验证明其具有较高的准确性与召回率,可以为政府相关部门加强互联网药品市场监管提供足够的信息依据.
Web信息提取、多维语义词典、互联网药品信息、结构语义熵、XPath
20
TP3;G25
2012-03-05(万方平台首次上网日期,不代表论文的发表时间)
共6页
50-54,19