一种面向中文拼写纠错的自监督预训练方法

引用

摘要：

预训练语言模型BERT/RoBERTa/MacBERT等虽然能够通过预训练任务中的掩码语言模型(MLM)很好地学习字和词的语法、语义及上下文特征,但其缺乏拼写错误识别及纠正能力,且在中文拼写纠错(CSC)任务中面临预训练与下游任务微调目标不一致的问题.为了进一步提升BERT/RoBERTa/MacBERT等模型的拼写错误识别及纠正能力,提出一种面向中文拼写纠错的自监督预训练方法MASC.MASC在MLM的基础上将对被掩码字的正确值预测转换成对拼写错误字的识别和纠正.首先,MASC将MLM对字的掩码扩展为相应的全词掩码,目的是提升BERT对单词级别的语义表征学习能力;接着,利用混淆集从音调相同、音调相近和字形相近等方面对MLM中的被掩码字进行替换,并将MLM的训练目标更改为识别正确的字,从而增强了BERT的拼写错误识别及纠正能力;最后,在 3个公开的CSC语料集sighan13、sighan14和sighan15上的实验结果表明,MASC可在不改变BERT/RoBERTa/MacBERT等模型结构的前提下进一步提升它们在下游CSC任务中的效果,并且消融实验也证明了全词掩码、音调和字形等信息的重要性.

关键词：中文拼写纠错、文本纠错、自然语言处理、预训练语言模型、深度学习、自监督

所属期刊栏目：51

分类号：TP183(自动化基础理论)

在线出版日期：2023-10-10（万方平台首次上网日期，不代表论文的发表时间）

页数：共9页

页码：90-98

英文信息展示

期刊专题