一种面向中文拼写纠错的自监督预训练方法

TP183; 预训练语言模型BERT/RoBERTa/MacBERT等虽然能够通过预训练任务中的掩码语言模型(MLM)很好地学习字和词的语法、语义及上下文特征,但其缺乏拼写错误识别及纠正能力,且在中文拼写纠错(CSC)任务中面临预训练与下游任务微调目标不一致的问题.为了进一步提升BERT/RoBERTa/MacBERT等模型的拼写错误识别及纠正能力,提出一种面向中文拼写纠错的自监督预训练方法MASC.MASC在MLM的基础上将对被掩码字的正确值预测转换成对拼写错误字的识别和纠正.首先,MASC将MLM对字的掩码扩展为相应的全词掩码,目的是提升BERT对单词级别的语义表征学习能力;接着,利用混淆...

Full description

Saved in:

Bibliographic Details
Published in	华南理工大学学报（自然科学版） Vol. 51; no. 9; pp. 90 - 98
Main Authors	苏锦钿, 余珊珊, 洪晓斌
Format	Journal Article
Language	Chinese
Published	华南理工大学计算机科学与工程学院,广东广州 510006%广东药科大学医药信息工程学院,广东广州 510006%华南理工大学机械与汽车工程学院,广东广州 510640 01.09.2023
Subjects	deep learning 预训练语言模型文本纠错 natural language processing 深度学习 Chinese spelling correction pre-trained language model 自然语言处理自监督 self-supervisory text correction 中文拼写纠错
Online Access	Get full text
ISSN	1000-565X
DOI	10.12141/j.issn.1000-565X.230031

Cover

More Information
Summary:	TP183; 预训练语言模型BERT/RoBERTa/MacBERT等虽然能够通过预训练任务中的掩码语言模型(MLM)很好地学习字和词的语法、语义及上下文特征,但其缺乏拼写错误识别及纠正能力,且在中文拼写纠错(CSC)任务中面临预训练与下游任务微调目标不一致的问题.为了进一步提升BERT/RoBERTa/MacBERT等模型的拼写错误识别及纠正能力,提出一种面向中文拼写纠错的自监督预训练方法MASC.MASC在MLM的基础上将对被掩码字的正确值预测转换成对拼写错误字的识别和纠正.首先,MASC将MLM对字的掩码扩展为相应的全词掩码,目的是提升BERT对单词级别的语义表征学习能力;接着,利用混淆集从音调相同、音调相近和字形相近等方面对MLM中的被掩码字进行替换,并将MLM的训练目标更改为识别正确的字,从而增强了BERT的拼写错误识别及纠正能力;最后,在 3个公开的CSC语料集sighan13、sighan14和sighan15上的实验结果表明,MASC可在不改变BERT/RoBERTa/MacBERT等模型结构的前提下进一步提升它们在下游CSC任务中的效果,并且消融实验也证明了全词掩码、音调和字形等信息的重要性.
ISSN:	1000-565X
DOI:	10.12141/j.issn.1000-565X.230031