10.3969/j.issn.1003-0077.2022.07.008
中文问句的形式分类和资源建设
该文归纳了问句形式在问句语料筛选中的作用,探索了问句分类必需的形式特征,同时通过人工标注建设了中文问句分类语料库,并在此基础上进行了基于规则和统计的分类实验,通过多轮实验迭代优化特征组合形成特征规则集,为当前问答提供形式上的分类基础.实验中,基于优化特征规则集的有限状态自动机可实现宏平均F1值为0.94;统计机器学习中随机森林模型的分类效果较好,F1值宏平均达到0.98.
疑问句、分类、形式特征、语料库
36
TP391(计算技术、计算机技术)
教育部人文社会科学研究项目20YJC740050
2022-09-19(万方平台首次上网日期,不代表论文的发表时间)
共8页
69-76