10.13266/j.issn.0252-3116.2015.14.018
基于LDA的科技创新主题语义识别研究
[目的/意义]由于传统科技创新主题概率识别方法忽略文本内容语义理解,为了更加准确地识别出主题,科技创新主题语义识别势在必行.[方法/过程]提出一种基于LDA的科技创新主题语义识别方法,利用语义角色标注技术对科技文献中的科技创新内容进行语义标引,构建LDA主题语义识别模型,根据表征科技创新内容的关键词语义角色对应的上位词的概率识别出科技创新主题.[结果/结论]通过以3D打印领域数据为对象进行实验,证明该方法能够更加准确地识别出科技创新主题,形成科技创新主题-主题词-科技文献的混合分布聚类集群,减少研究背景等无关数据干扰,避免语义含义相同的科技创新主题词重复统计问题.
语义角色标注、科技创新主题、LDA模型、3D打印
G250.2(图书馆学、图书馆事业)
本文系教育部人文社会科学研究青年基金“长句检索中信息查询扩展研究”编号:12YJC870001和文化部科技创新项目“大规模学术文献并行处理与自动分类研究”研究成果之一.
2015-10-16(万方平台首次上网日期,不代表论文的发表时间)
126-134