10.3969/j.issn.1000-7024.2012.08.027
基于Web挖掘的化学物质信息提取应用研究
针对多信息源网站中化学物质信息的获取与数据库的更新查询问题,运用网络爬虫技术和包装器方法实现数据的抽取;采用自定义XML文件的方式,提出了任务分割、动态更新检查、失败重试机制方法,实现了动态信息源网站中化学物质信息的持续、实时抽取,并进行异常处理和监控.将抽取的数据运用正则表达式和排序算法进行预处理并构建全面而准确的化学品环境安全数据库,最终实现了对原有数据的更新查询,在一定程度上保证了可靠性、可用性、可扩展性、可维护性.
Web信息抽取、任务分割、重试机制、持续抽取、数据预处理
33
TP311.52(计算技术、计算机技术)
公益性行业环保科研专项基金项目200909086
2012-11-26(万方平台首次上网日期,不代表论文的发表时间)
共7页
3040-3046