基于共现的汉语词的分布表示学习与改进

引用

摘要：

词与其上下文的共现矩阵是词的分布表示学习的关键.在构造共现矩阵时,可采用不同方法来度量词与其上下文之间的关联.文中首先介绍了3种词与其上下文的关联度量方法并构造了相应的共现矩阵,使用同一个优化求解框架学习得到词的分布表示,在中文词语类比任务和语义相似性任务上的评价结果显示,GloVe方法的结果最好;然后进一步对GloVe方法进行了改进,通过引入一个超参数校正词与其上下文的共现次数,以使校正后的共现次数近似服从Zip'f分布,并给出了求解该超参数估计值的方法.基于改进后的方法学习得到的词的分布表示在词语类比任务上的准确率提高了0.67％,且在Mc-Nemar检验下是显著的;在词语相似性任务上的性能提高了5.6％.此外,将改进后的方法得到的词的分布表示应用到语义角色识别任务中,作为词特征的初始向量得到的F1值相比使用改进前的词的分布得到的F1值也提高了0.15％,且经3×2交叉验证的Bayes检验其提升也较为显著.

关键词：分布表示、共现、词语类比、词语相似性、Zip’f分布

所属期刊栏目：48

分类号：TP391(计算技术、计算机技术)

资助基金：国家自然科学基金;国家自然科学基金;国家自然科学基金;基础研究项目

在线出版日期：2021-06-28（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：222-226

英文信息展示

期刊专题