10.3969/j.issn.1673-629X.2022.12.018
面向未登录词及多义词的共现性词嵌入改进
基于语料库构建词语语义性向量的词嵌入模型,可以定量刻画词语的上下文语义.然而,传统的词嵌入模型在揭示一词多义词汇的语义时,存在着语义空间向量维度不确定或缺乏直观可解释性等局限,此外,对于词汇表外未登录新词语的语义性嵌入识别,尚缺乏有效的途径.针对一词多义问题和未登录词问题,可将词嵌入的优势和词共现的优势相融合,以弥补传统词嵌入模型的语义空间维度不确定、语义维度不可解释及未登录词忽略等方面的不足.主要创新工作包括:基于训练后的词嵌入矩阵与单词归一化的共现矩阵,构建全局性语料词向量;为未登录词创建语料词向量,并与全局性语料词向量进行权重融合,以提高词嵌入的精确率.通过公开数据集的两项实验结果表明,基于词共现的一词多义及未登录词嵌入模型,可有效提升词嵌入的精确度,并可缩短词嵌入的进程时间.
词嵌入、未登录词、多义词、共现矩阵、词向量
32
TP391(计算技术、计算机技术)
国家自然科学基金;国家自然科学基金;江苏省社科基金项目;江苏省研究生科研创新项目
2023-01-07(万方平台首次上网日期,不代表论文的发表时间)
共6页
117-122