融合语义知识的藏文网页关键词提取方法研究

引用

摘要：

文章归纳整理了藏文网页的结构特征,在借鉴中英文关键词抽取方法的基础上,设计实现了融合语义知识的藏文网页关键词抽取算法.该算法利用藏文文本特征实现了网页内容模块的智能识别,在对识别的文本块进行自动分词后,采用改进的TF-IDF算法得到基础词集,然后根据词向量特征进行基础词的语义扩展构建候选关键词集,最后利用候选关键词之间的语义相关度值,确立藏文网页的关键词.藏文网页的实验测试结果表明该方法提取的藏文网页关键词具有较高的准确率.

关键词：藏文网页、TF-IDF、语义扩展、关键词抽取

分类号：TP3;H08

资助基金：西藏自治区高校青年教师创新支持计划项目“基于藏文Web文本的关联知识挖掘方法研究”QCZ2016-44;西藏自治区自然科学基金项目“基于语义的藏文百科知识问答系统关键技术的研究”2016ZR-MY-04

在线出版日期：2017-04-17（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：59-64,77

期刊专题